Multi-modal Video Understanding on MMMU Video
48.7ScoreQwen2.5VL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5VL-7BBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F32 (1×) / 100%2026.05 | 48.7 | |
| EchoPruneBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 48.4 | |
| FlashVIDBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 43.2 | |
| EchoPruneBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 43.1 | |
| RandomBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 42.3 | |
| Qwen2.5VL-3BBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F32 (1×) / 100%2026.05 | 41.1 | |
| FlashVIDBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 40.7 | |
| MI-PrunerBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 40.2 | |
| RandomBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 40.1 | |
| MI-PrunerBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 39.3 |