Long Video Understanding on MLVU (651s)
78.1AccuracyQwen3-VL*
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL*Size=8B, Tokens per frame=≤ 6402026.04 | 78.1 | |
| Tempo*Size=6B, Tokens per frame=0.5–16, Visual Budget=4K, Actual tokens/frame=2.82026.04 | 75.6 | |
| Tempo*Size=6B, Tokens per frame=0.5–16, Visual Budget=8K, Actual tokens/frame=3.32026.04 | 75.2 | |
| VideoChat-FlashSize=7B, Tokens per frame=162026.04 | 74.7 | |
| VideoLLaMA3*Size=7B, Tokens per frame=≤ 912026.04 | 73 | |
| StormSize=7B, Tokens per frame=642026.04 | 72.9 | |
| BIMBASize=7B, Tokens per frame=362026.04 | 71.4 | |
| LLaVA-VideoSize=7B, Tokens per frame=6762026.04 | 70.8 | |
| InternVL3.5Size=8B, Tokens per frame=2562026.04 | 70.2 | |
| Qwen2.5-VLSize=7B, Tokens per frame=19242026.04 | 70.2 | |
| Qwen3-VL*Size=2B, Tokens per frame=≤ 6402026.04 | 68.3 | |
| LongVUSize=7B, Tokens per frame=642026.04 | 65.4 | |
| LLaVA-OneVisionSize=7B, Tokens per frame=1962026.04 | 64.7 | |
| GPT-4oSize=-, Tokens per frame=-2026.04 | 64.6 | |
| KangarooSize=8B, Tokens per frame=2562026.04 | 61 | |
| LongVASize=7B, Tokens per frame=1442026.04 | 56.3 | |
| VideoChat2-HDSize=7B, Tokens per frame=722026.04 | 47.9 | |
| LLaMA-VIDSize=7B, Tokens per frame=22026.04 | 33.2 |