Video Understanding on VideoMME v1.0 (test)
60.8ScoreFastV (ECCV2024) + DyToK (7B)
Evaluation Results
| Method | Links | |
|---|---|---|
| FastV (ECCV2024) + DyToK (7B)Token Retention Ratio=50%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B2025.12 | 60.8 | |
| Vanilla (TMLR)Token Retention Ratio=100%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 60.7 | |
| FastV (ECCV2024) + DyToK (7B)Token Retention Ratio=75%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B2025.12 | 60.7 | |
| VisionZip† + DyToK (7B)Token Retention Ratio=50%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B, Pooling Compatibility=true2025.12 | 60.2 | |
| VisionZip† + DyToK (7B)Token Retention Ratio=25%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B, Pooling Compatibility=true2025.12 | 59.9 | |
| VisionZip†Token Retention Ratio=75%, Backbone=Qwen2.5-VL, Input Frames=32, Pooling Compatibility=true2025.12 | 59.7 | |
| VisionZip†Token Retention Ratio=50%, Backbone=Qwen2.5-VL, Input Frames=32, Pooling Compatibility=true2025.12 | 59.6 | |
| VisionZip† + DyToK (7B)Token Retention Ratio=75%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B, Pooling Compatibility=true2025.12 | 59.3 | |
| VisionZip†Token Retention Ratio=25%, Backbone=Qwen2.5-VL, Input Frames=32, Pooling Compatibility=true2025.12 | 59.2 | |
| FastV (ECCV2024) + DyToK (7B)Token Retention Ratio=25%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B2025.12 | 58.8 | |
| FastV (ECCV2024)Token Retention Ratio=75%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 58.7 | |
| VisionZip† + DyToK (7B)Token Retention Ratio=15%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B, Pooling Compatibility=true2025.12 | 58.4 | |
| VisionZip†Token Retention Ratio=15%, Backbone=Qwen2.5-VL, Input Frames=32, Pooling Compatibility=true2025.12 | 58.3 | |
| VisionZip† + DyToK (7B)Token Retention Ratio=10%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B, Pooling Compatibility=true2025.12 | 57.1 | |
| FastV (ECCV2024) + DyToK (7B)Token Retention Ratio=15%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B2025.12 | 56.9 | |
| VisionZip†Token Retention Ratio=10%, Backbone=Qwen2.5-VL, Input Frames=32, Pooling Compatibility=true2025.12 | 55.8 | |
| FastV (ECCV2024)Token Retention Ratio=50%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 55.7 | |
| FastV (ECCV2024)Token Retention Ratio=25%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 53.1 | |
| FastV (ECCV2024)Token Retention Ratio=15%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 48.9 | |
| FastV (ECCV2024)Token Retention Ratio=10%, Backbone=Qwen2.5-VL, Input Frames=322025.12 | 42.3 | |
| FastV (ECCV2024) + DyToK (7B)Token Retention Ratio=10%, Backbone=Qwen2.5-VL, Input Frames=32, Model Scale=7B2025.12 | 42.3 |