Video Question Answering on NExT-QA (test)
86.3AccuracyGPT-5
Evaluation Results
| Method | Links | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5Access Type=API call only2026.01 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Molmo2-8BAccess Type=Molmo2 family2026.01 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-Flash-7BAccess Type=Open models2026.01 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Molmo2-4BAccess Type=Molmo2 family2026.01 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 2.5 ProAccess Type=API call only2026.01 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oryx-1.5Size=32B2024.09 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eagle2.5-8BAccess Type=Open weights only2026.01 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 3 ProAccess Type=API call only2026.01 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Molmo2-O-7BAccess Type=Molmo2 family2026.01 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PLM-8BAccess Type=Open models2026.01 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BIMBA-LLaVALLM=Qwen2-7B, Frames=1282025.03 | 83.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OryxSize=34B2024.09 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8BAccess Type=Open weights only2026.01 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PLM-3BAccess Type=Open models2026.01 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoLLM=Qwen2-7B, Frames=642025.03 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-5 miniAccess Type=API call only2026.01 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-7BAccess Type=Open models2026.01 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3 + HFSLLM size=8B+1.5B, # Frames=162025.12 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VILA-1.5Size=40B2024.09 | 82.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVILALLM size=8B, # Frames=2562025.12 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STARBase Model=GPT-4o, Frames=7.22025.12 | 82.1 | 81.1 | 81.5 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OryxSize=7B2024.09 | 81.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oryx-1.5Size=7B2024.09 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 2.5 FlashAccess Type=API call only2026.01 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oryx-1.5LLM size=7B, # Frames=64/2562025.12 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3LLM size=8B, # Frames=16, reproduced=true2025.12 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8BAccess Type=Open weights only2026.01 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4BAccess Type=Open weights only2026.01 | 81.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLM-4.1V-9BAccess Type=Open weights only2026.01 | 81.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BBase Model=-, Frames=2 fps2025.12 | 80.9 | 80.6 | 79.3 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Detector-based T*Base Model=GPT-4o, Frames=82025.12 | 80.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-4BAccess Type=Open weights only2026.01 | 80.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=72B2024.09 | 80.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2-HDSize=7B2024.09 | 79.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=7B2024.09 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionLLM=Qwen2-7B, Frames=322025.03 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CREMAModality=V, F, D, LLM=Mistral-7B, Tr. Params.=45M2024.02 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionLLM size=7B, # Frames=322025.12 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL + HFSLLM size=7B+1.5B, # Frames=162025.12 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude Sonnet 4.5Access Type=API call only2026.01 | 79.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=14B2024.07 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CREMAModality=V, F, LLM=Mistral-7B, Tr. Params.=21M2024.02 | 78.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-V-4.5-8BAccess Type=Open weights only2026.01 | 78.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2*Modality=V, LLM=Mistral-7B, Tr. Params.=>200M, Note=reproduced2024.02 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL + M-LLMLLM size=7B+1.5B2025.12 | 78.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=7B2024.07 | 78.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTModality=V, LLM=Qwen1.5-7B, Tr. Params.=7B2024.02 | 78.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AKeySBase Model=GPT-4o, Frames=7.62025.12 | 78.1 | 72.9 | 79 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=7B, Training Protocol=DPO2024.07 | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLLLM size=7B, # Frames=16, reproduced=true2025.12 | 77.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VLLLM size=7B2025.12 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-XLLLM size=7B2025.12 | 77.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BIMBA-LLAMALLM=LLaMA3.2-8B, Frames=642025.03 | 76.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MotionEpic - VoTModality=V, LLM=Vicuna-7B, Tr. Params.=>100M2024.02 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Keye-VL-1.5-8BAccess Type=Open weights only2026.01 | 75.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8BBase Model=-, Frames=82025.12 | 75.7 | 77.5 | 72.1 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoTreeLLM=GPT42025.03 | 75.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoTreeBase Model=GPT-4, Frames=63.22025.12 | 75.6 | 70.6 | 76.5 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VidF4Base Model=-, Frames=82025.12 | 74.1 | 69.6 | 74.2 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CREMAModality=V, F, D, N, Trainable Params.=28M, GFLOPS=2.47K, Evaluation Protocol=Fine-tuned2024.02 | 73.9 | 74.4 | 69.4 | 81.6 | — | — | 71.3 | 75.5 | 67.3 | 72.5 | 66.1 | 92.9 | 79.7 | — | — | — | — | — | — | — | — | |
| SeViLAModality=V, Trainable Params.=216M, Evaluation Protocol=Fine-tuned2024.02 | 73.8 | 74.2 | 69.4 | 81.3 | — | — | 71.3 | 75.3 | 67.8 | 71.7 | 67.2 | 91.8 | 85.2 | — | — | — | — | — | — | — | — | |
| LLaMA-3.2 (Video)LLM=LLaMA3.2-8B, Frames=642025.03 | 73.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=SFT2024.07 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-2Modality=V, F, D, N, Trainable Params.=432M, GFLOPS=6.12K, Evaluation Protocol=Fine-tuned2024.02 | 73.3 | 73.5 | 68.5 | 82.1 | — | — | 71.7 | 74.2 | 65.7 | 72.6 | 65.5 | 92.5 | 81.9 | — | — | — | — | — | — | — | — | |
| Mirasol3BNumber of frames=512, Combiner type=TTM2023.11 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mirasol3BModality=V, Trainable Params.=3B, Evaluation Protocol=Fine-tuned2024.02 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CREMAModality=V, F, D, Trainable Params.=20M, GFLOPS=2.34K, Evaluation Protocol=Fine-tuned2024.02 | 73.2 | 73.3 | 69 | 80.8 | — | — | 70.4 | 74.4 | 66.6 | 72.4 | 61 | 92.5 | 81 | — | — | — | — | — | — | — | — | |
| LVNetBase Model=GPT-4o, Frames=122025.12 | 72.9 | 65.5 | 75 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PLLAVA (LLaMA-3.2)LLM=LLaMA3.2-8B, Frames=642025.03 | 72.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-2Modality=V, F, D, Trainable Params.=324M, GFLOPS=5.03K, Evaluation Protocol=Fine-tuned2024.02 | 72.7 | 73.3 | 67.6 | 81.4 | — | — | 70.8 | 74.2 | 65 | 71.4 | 61.5 | 93.2 | 81.6 | — | — | — | — | — | — | — | — | |
| BLIP-2Modality=V, Trainable Params.=108M, GFLOPS=1.30K, Evaluation Protocol=Fine-tuned2024.02 | 72.6 | 72.9 | 68.1 | 81.2 | — | — | 69.9 | 73.9 | 65.4 | 71.9 | 64.9 | 91.8 | 80.3 | — | — | — | — | — | — | — | — | |
| BLIP-2Modality=V, F, Trainable Params.=216M, GFLOPS=2.21K, Evaluation Protocol=Fine-tuned2024.02 | 72.6 | 72.6 | 68 | 81.9 | — | — | 68.8 | 74 | 65.8 | 71.1 | 64.9 | 92.8 | 81.3 | — | — | — | — | — | — | — | — | |
| CREMAModality=V, F, Trainable Params.=8M, GFLOPS=2.22K, Evaluation Protocol=Fine-tuned2024.02 | 72.4 | 72.8 | 66.9 | 82.2 | — | — | 69.3 | 74.1 | 64.4 | 70.5 | 67.2 | 92.8 | 80.9 | — | — | — | — | — | — | — | — | |
| BIMBA-LLaVALLM=Vicuna-7B, Frames=642025.03 | 72.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mirasol3BNumber of frames=5122023.11 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.07 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-VQAModality=V, LLM=LLAMA2-7B, Tr. Params.=5M2024.02 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-VQA (7B)Modality=V, Trainable Params.=5M, Evaluation Protocol=Fine-tuned2024.02 | 72 | — | 69.2 | 75.8 | — | — | — | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CREMAModality=V, Trainable Params.=4M, GFLOPS=1.30K, Evaluation Protocol=Fine-tuned2024.02 | 71.6 | 72.1 | 65.9 | 81.6 | — | — | 67.3 | 73.9 | 63 | 70.2 | 64.9 | 93.2 | 80.3 | — | — | — | — | — | — | — | — | |
| TarsierLLM size=7B, # Frames=82025.12 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=SFT2024.07 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoAgentLLM=GPT42025.03 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoAgentBase Model=GPT-4, Frames=8.22025.12 | 71.3 | 64.5 | 72.7 | 81.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LVNetLLM size=7B, # Frames=122025.12 | 71.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IG-VLM (LLAVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.07 | 70.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Next-VideoSize=34B2024.09 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2Size=7B2024.07 | 68.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2Modality=V, LLM=Vicuna-7B, Tr. Params.=>200M2024.02 | 68.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVALLM=Qwen2-7B, Frames=1282025.03 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mirasol3BNumber of frames=1282023.11 | 68.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PLLAVALLM=Vicuna-7B, Frames=162025.03 | 68.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HawkEyeFine-tuned=false, Strict zero-shot=false2024.03 | 67.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=SFT2024.07 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT (Video)LLM=Vicuna-7B, Frames=642025.03 | 67.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVULLM=Qwen2-7B, Frames=1fps2025.03 | 67.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PLLAVALLM=Vicuna-7B, Frames=642025.03 | 67.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2 (our impl.)Fine-tuned=false, Implementation=Reproduced, Strict zero-shot=false2024.03 | 66.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat2Fine-tuned=false, Strict zero-shot=false2024.03 | 66.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLoViLLM=GPT3.52025.03 | 66.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-LLaVAModality=V, LLM=Vicuna-7B, Tr. Params.=7B2024.02 | 66.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |