Long Video Understanding on LVBench 4101s
58AccuracyQwen3-VL*
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL*Size=8B, Tokens per frame=≤ 6402026.04 | 58 | |
| Molmo2Size=8B, Tokens per frame=832026.04 | 52.8 | |
| Tempo*Size=6B, Tokens per frame=0.5–16, Visual Budget=4K, Actual tokens/frame=2.92026.04 | 52.7 | |
| Tempo*Size=6B, Tokens per frame=0.5–16, Visual Budget=8K, Actual tokens/frame=3.52026.04 | 52.3 | |
| VideoChat-FlashSize=7B, Tokens per frame=162026.04 | 48.2 | |
| Qwen3-VL*Size=2B, Tokens per frame=≤ 6402026.04 | 47.4 | |
| VideoLLaMA3*Size=7B, Tokens per frame=≤ 912026.04 | 45.3 | |
| Qwen2.5-VLSize=7B, Tokens per frame=19242026.04 | 45.3 | |
| KangarooSize=8B, Tokens per frame=2562026.04 | 39.4 | |
| Gemini 1.5 ProSize=-, Tokens per frame=-2026.04 | 33.1 | |
| GPT-4oSize=-, Tokens per frame=-2026.04 | 30.8 | |
| LLaMA-VIDSize=7B, Tokens per frame=22026.04 | 23.9 |