Video Understanding on MLVU (M-Avg and Relative M-Avg)
70.2M-AvgVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBackbone=Qwen2.5-VL 7B, Token reduction ratio=0%2024.12 | 70.2 | 100 | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 69.8 | 98.6 | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 69.3 | 97.8 | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 69 | 97.3 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 68.4 | 96.9 | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 68.2 | 96.6 | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 67.1 | 95.5 | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 67.1 | 95.4 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 67 | 95.1 | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 66.9 | 95.3 | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 65.7 | 93.5 |