Video Question Answering on Video-MME (Length and Subtitle Breakdown)
82.8Accuracy (Average, wo/ Subtitle)A4VL
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| A4VL2026.03 | 82.8 | 86.6 | 87.3 | 76.8 | 83.2 | 68.3 | 77.9 | 77.2 | |
| Gemini 1.5ProSource=Paper/Leaderboard2026.03 | 81.3 | 81.7 | 84.5 | 74.3 | 81 | 67.4 | 77.4 | 75 | |
| LVAgent2026.03 | 79.5 | 82.4 | 83.6 | 72.8 | 78.6 | 66.3 | 76.4 | 73.9 | |
| GPT-4oSource=Paper/Leaderboard2026.03 | 77.2 | 80 | 82.8 | 70.3 | 76.6 | 65.3 | 72.1 | 71.9 | |
| LLaVA-Video-72B-Qwen2Model Size=72B, Backbone=Qwen22026.03 | 74.6 | 77.8 | 80 | 64.9 | 70.8 | 58.6 | 73 | 67.1 | |
| InternVL3-78BModel Size=78B2026.03 | 73.9 | 78.6 | 80.4 | 65.4 | 73.4 | 56.7 | 67.8 | 66.9 | |
| QwenVL-2.5-72BModel Size=72B2026.03 | 73.7 | 75.1 | 77 | 66.3 | 73.3 | 59.6 | 70.8 | 67 | |
| VideoLucyVenue=NeurIPS’25, Base Model=DeepSeek-R1, #Frames=-2025.10 | 72.5 | — | — | — | — | — | — | — | |
| InternVL3.5-38BModel Size=38B2026.03 | 72.1 | 76.1 | 79.1 | 58.6 | 68.9 | 57.4 | 68.3 | 64 | |
| Aria-25.3BModel Size=25.3B, Source=Paper/Leaderboard2026.03 | 72.1 | 67.9 | 78.3 | 67 | 71.7 | 58.8 | 66.3 | 67.6 | |
| QwenVL-2.5-32BModel Size=32B2026.03 | 71.3 | 73.2 | 77.1 | 61.6 | 68.2 | 54.1 | 68.6 | 63 | |
| VideoLlama3-7BModel Size=7B2026.03 | 70.3 | 80.1 | 80.2 | 63.7 | 69.6 | 54.9 | 61 | 66.2 | |
| LLaVA-OneVision-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | 69.6 | 76.7 | 79.3 | 62.2 | 66.9 | 66 | 62.4 | 66.3 | |
| A.I.R. + InternVL-3LLM Size=8B, #Frames=≤ 322025.10 | 68.2 | — | — | — | — | — | — | 69.2 | |
| A.I.R.Venue=-, Base Model=InternVL3-8B, #Frames=≤322025.10 | 68.2 | — | — | — | — | — | — | 69.2 | |
| InternVL-3 + MDP3LLM Size=8B, #Frames=32, Source=Reproduced2025.10 | 66.8 | — | — | — | — | — | — | 69 | |
| InternVL3.5-8BModel Size=8B2026.03 | 66.6 | 69.6 | 74 | 56.3 | 63.9 | 47.7 | 61.9 | 57.9 | |
| LLaVA-Video-7B-Qwen2Model Size=7B, Backbone=Qwen22026.03 | 66.4 | 72.4 | 75.6 | 58.1 | 63.3 | 50.7 | 60.4 | 60.4 | |
| InternVL-3 (reported)LLM Size=8B, #Frames=max: 64, Source=Reported2025.10 | 66.3 | — | — | — | — | — | — | 68.9 | |
| QwenVL-2.5-7BModel Size=7B2026.03 | 66.1 | 72.1 | 73.6 | 55.7 | 63.9 | 48.2 | 60.9 | 58.7 | |
| InternVL-3 (reproduced)LLM Size=8B, #Frames=32, Source=Reproduced2025.10 | 65.6 | — | — | — | — | — | — | 67.3 | |
| QwenVL-2.5 (reported)LLM Size=7B, #Frames=max: 768, Source=Reported2025.10 | 65.1 | — | — | — | — | — | — | 71.6 | |
| A.I.R.Venue=-, Base Model=GPT-4o, #Frames=≤322025.10 | 65.1 | — | — | — | — | — | — | — | |
| A.I.R. + QwenVL-2.5LLM Size=7B, #Frames=≤ 322025.10 | 65 | — | — | — | — | — | — | 66.3 | |
| QwenVL-2.5 + MDP3LLM Size=7B, #Frames=32, Source=Reproduced2025.10 | 63.8 | — | — | — | — | — | — | 65.7 | |
| MemVidVenue=arXiv’25, Base Model=Qwen2VL-7B, #Frames=1282025.10 | 63.7 | — | — | — | — | — | — | 65.7 | |
| A.I.R. + LLaVA-OneVisionLLM Size=7B, #Frames=≤ 322025.10 | 61.4 | — | — | — | — | — | — | 65.1 | |
| A.I.R.Venue=-, Base Model=LLaVA-OV-7B, #Frames=≤322025.10 | 61.4 | — | — | — | — | — | — | 65.1 | |
| QwenVL-2.5 (reproduced)LLM Size=7B, #Frames=32, Source=Reproduced2025.10 | 60.8 | — | — | — | — | — | — | 62.7 | |
| LongVU-7BModel Size=7B, Source=Paper/Leaderboard2026.03 | 60.6 | — | — | — | — | — | 59.5 | — | |
| LLaVA-OneVision + MDP3LLM Size=7B, #Frames=32, Source=Reproduced2025.10 | 60.5 | — | — | — | — | — | — | 64 | |
| A.I.R.Venue=-, Base Model=Qwen2VL-7B, #Frames=≤322025.10 | 60 | — | — | — | — | — | — | 63.1 | |
| LLaVA-OneVision + BOLTLLM Size=7B, #Frames=32, Source=Reported2025.10 | 59.9 | — | — | — | — | — | — | — | |
| LLaVA-OneVision (reproduced)LLM Size=7B, #Frames=32, Source=Reproduced2025.10 | 58.5 | — | — | — | — | — | — | 61.7 | |
| LLaVA-OneVision + AKSLLM Size=7B, #Frames=32, Source=Reported2025.10 | 58.4 | — | — | — | — | — | — | — | |
| LLaVA-OneVision (reported)LLM Size=7B, #Frames=32*, Source=Reported2025.10 | 58.2 | — | — | — | — | — | — | 61.5 | |
| LLaVA-NeXT-Video-34BModel Size=34B2026.03 | 56 | 63.1 | 66.4 | 51.1 | 53.2 | 44.6 | 48.7 | 52.5 | |
| LongVA-7BModel Size=7B, Source=Paper/Leaderboard2026.03 | 54.3 | 61.1 | 61.6 | 50.4 | 53.6 | 46.2 | 47.6 | 52.6 | |
| A.I.R. + VILA-1.5LLM Size=8B, #Frames=82025.10 | 53.7 | — | — | — | — | — | — | 58.6 | |
| DYTO-34BModel Size=34B, Source=Paper/Leaderboard2026.03 | 53.4 | — | — | — | — | — | — | — | |
| VILA-1.5 + MDP3LLM Size=8B, #Frames=8, Source=Reproduced2025.10 | 53.3 | — | — | — | — | — | — | 57.8 | |
| VILA-1.5 + Q-FrameLLM Size=8B, #Frames=8, Source=Reported2025.10 | 50.7 | — | — | — | — | — | — | 55 | |
| VILA-1.5 + Frame-VoyagerLLM Size=8B, #Frames=8, Source=Reported2025.10 | 50.5 | — | — | — | — | — | — | 53.6 | |
| VILA-1.5 (reproduced)LLM Size=8B, #Frames=8, Source=Reproduced2025.10 | 48.9 | — | — | — | — | — | — | 54.2 | |
| DynFocusSource=Paper/Leaderboard2026.03 | 47.8 | 50.9 | 53.9 | 43.7 | 46 | 37.7 | 43.6 | 44.1 | |
| VILA-1.5 (reported)LLM Size=7B, #Frames=8, Source=Reported2025.10 | 47.5 | — | — | — | — | — | — | — | |
| VideoChat2-7BModel Size=7B, Source=Paper/Leaderboard2026.03 | 43.8 | 48.3 | 52.8 | 37 | 39.4 | 33.2 | 39.2 | 39.5 | |
| LLaVA-NeXT-Video-7BModel Size=7B2026.03 | 31.8 | 36.4 | 40.1 | 30.8 | 38 | 27.9 | 17.2 | 31.7 | |
| BOLTSource=Paper/Leaderboard2026.03 | — | 70.1 | — | 66 | — | 49.6 | — | 59.9 | |
| VideoRAG-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | — | 81.1 | — | 72.9 | — | 73.1 | — | 75.7 |