Video Understanding on EgoSchema (test)
77.9AccuracyQwen2-VL-72B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2-VL-72BParameters=72B2024.09 | 77.9 | — | |
| GPT-5Access Type=API call only2026.01 | 75.6 | — | |
| Claude Sonnet 4.5Access Type=API call only2026.01 | 73.1 | — | |
| GPT-4o2024.09 | 72.2 | — | |
| Gemini 2.5 ProAccess Type=API call only2026.01 | 72.2 | — | |
| Eagle2.5-8BAccess Type=Open weights only2026.01 | 72.2 | — | |
| Gemini-1.5-ProInput Res.=768×768, Num Frames=322025.03 | 72.2 | — | |
| GPT-5 miniAccess Type=API call only2026.01 | 70.9 | — | |
| Gemini 2.5 FlashAccess Type=API call only2026.01 | 70.2 | — | |
| Qwen3-VL-8BAccess Type=Open weights only2026.01 | 69.8 | — | |
| Gemini 3 ProAccess Type=API call only2026.01 | 68.9 | — | |
| PLM-8BAccess Type=Open models2026.01 | 68.8 | — | |
| Qwen3-VL-4BAccess Type=Open weights only2026.01 | 68.4 | — | |
| PLM-3BAccess Type=Open models2026.01 | 66.9 | — | |
| Qwen2-VL-7BParameters=7B2024.09 | 66.7 | — | |
| Qwen2-VL-7B-Ins.Backbone=7B-Instruct2024.12 | 66.7 | — | |
| Gemini-1.5-FlashInput Res.=768×768, Num Frames=322025.03 | 65.7 | — | |
| VanillaBackbone=Qwen2.5-VL 7B, Token reduction ratio=0%2024.12 | 65 | 100 | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 63.3 | 97.4 | |
| Gemini 1.5-Pro2024.09 | 63.2 | — | |
| iLLaVABackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 62.7 | 96.4 | |
| GLM-4.1V-9BAccess Type=Open weights only2026.01 | 62.6 | — | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 62.5 | 96.2 | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 62.3 | 95.9 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 62.2 | 95.8 | |
| Previous SoTA2024.09 | 62 | — | |
| LLaVA-OV-72BBackbone=72B2024.12 | 62 | — | |
| Molmo2-8BAccess Type=Molmo2 family2026.01 | 62 | — | |
| FasterVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 61.8 | 95 | |
| VisionZipBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 61.7 | 94.9 | |
| PyramidDropBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 61.5 | 94.6 | |
| Molmo2-4BAccess Type=Molmo2 family2026.01 | 61.2 | — | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=90%2024.12 | 61.1 | 94 | |
| SparseVLMBackbone=Qwen2.5-VL 7B, Token reduction ratio=95%2024.12 | 60.5 | 93 | |
| LLaVA-OV-7BBackbone=7B2024.12 | 60.1 | — | |
| InternVL3.5-4BAccess Type=Open weights only2026.01 | 58.9 | — | |
| LLaVA-OV-72Bvariant=Single-Image (SI), Backbone=72B2024.12 | 58.6 | — | |
| InternVL3.5-8BAccess Type=Open weights only2026.01 | 58.6 | — | |
| MAmmoTH-VL-8BBackbone=8B2024.12 | 58.5 | — | |
| LLaVA-Video-7BAccess Type=Open models2026.01 | 57.3 | — | |
| Molmo2-O-7BAccess Type=Molmo2 family2026.01 | 56.8 | — | |
| Keye-VL-1.5-8BAccess Type=Open weights only2026.01 | 56.3 | — | |
| Qwen2-VL-2BParameters=2B2024.09 | 54.9 | — | |
| VideoChat2-7BTotal Params=7.3B, Input Res.=224×224, Num Frames=16, Throughput=11.42025.03 | 54.4 | — | |
| InternVL-2-8BBackbone=8B2024.12 | 54.2 | — | |
| LLaVA-OV-7Bvariant=Single-Image (SI), Backbone=7B2024.12 | 52.9 | — | |
| VideoChat-Flash-7BAccess Type=Open models2026.01 | 51.3 | — | |
| LLaVA-Mini-8BTotal Params=8.4B, Input Res.=336×336, Num Frames=1fps, Throughput=4.62025.03 | 51.2 | — | |
| MiniCPM-V-4.5-8BAccess Type=Open weights only2026.01 | 49.6 | — | |
| Video-LLaVA-7BTotal Params=7.3B, Input Res.=224×224, Num Frames=8, Throughput=12.52025.03 | 45.3 | — | |
| LLaMA-VID-7BTotal Params=7.3B, Input Res.=336×336, Num Frames=1fps, Throughput=6.02025.03 | 38.5 | — | |
| Mobile-VideoGPT-1.5BTotal Params=1.6B, Input Res.=224×224, Num Frames=16, Throughput=41.02025.03 | 36.7 | — | |
| Video-ChatGPT-3.8BTotal Params=4.2B, Input Res.=224×224, Num Frames=100, Throughput=14.12025.03 | 36.2 | — | |
| Mobile-VideoGPT-0.5BTotal Params=0.6B, Input Res.=224×224, Num Frames=16, Throughput=45.92025.03 | 31.4 | — | |
| LLaVA-OneVision-0.5BTotal Params=1.0B, Input Res.=384×384, Num Frames=32, Throughput=22.72025.03 | 26.8 | — |