Video Understanding on Video Benchmarks Aggregate
68.3Average ScoreVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBackbone=Qwen2.5-VL 7B, Token reduction ratio=0%2024.12 | 68.3 | 100 | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 68.2 | 97.8 | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 67 | 96.7 | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 66.9 | 96.8 | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 66.6 | 96.2 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 66.5 | 96.1 | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 65.5 | 95.1 | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 65.3 | 95.3 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 64.9 | 94.8 | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 64 | 94.5 | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 63.1 | 93.2 | |
| KiTokeRetention Ratio γ=25%2026.04 | 59.4 | 100.5 | |
| LLaVA-OV-7BRetention Ratio γ=100%2026.04 | 59.1 | 100 | |
| KiTokeRetention Ratio γ=10%2026.04 | 58.2 | 98.5 | |
| HoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 57.81 | — | |
| VideoRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 57.75 | — | |
| MRoPE-IBackbone=Qwen3-VL-8B-Instruct2025.10 | 57.64 | — | |
| MHRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 57.46 | — | |
| MRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 57.03 | — | |
| RoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 56.78 | — | |
| KiTokeRetention Ratio γ=5%2026.04 | 56.2 | 95.1 | |
| CircleRoPEBackbone=Qwen3-VL-8B-Instruct2025.10 | 54.88 | — | |
| HoPE2025.10 | 52.95 | — | |
| KiTokeRetention Ratio γ=1%2026.04 | 52.7 | 89.2 | |
| MHRoPE2025.10 | 52.58 | — | |
| MRoPE-I2025.10 | 52.36 | — | |
| VideoRoPE2025.10 | 52.18 | — | |
| Vanilla RoPE2025.10 | 51.64 | — | |
| MRoPE2025.10 | 51.51 | — | |
| CircleRoPE2025.10 | 51.09 | — |