Video Question Answering on MVBench
81.3AccuracyGemini 1.5 Pro
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Gemini 1.5 Pro# Frames=-2024.10 | 81.3 | — | — | — | — | |
| PLM 8BParams Enc / LLM=1B/8B, Evaluation Protocol=zero-shot2025.06 | 77.1 | — | — | — | — | |
| InternVideo2.5 (InternVL2.5+LRC)Size=7B, #Tokens=162025.01 | 75.7 | — | — | — | — | |
| QwenVL2Size=72B2025.01 | 73.6 | — | — | — | — | |
| V-JEPA 2Params Enc / LLM=1B/8B, Evaluation Protocol=zero-shot2025.06 | 73.5 | — | — | — | — | |
| VideoChat-FlashSize=7B, #Tokens=162025.01 | 73.2 | — | — | — | — | |
| InternVL-2.5Params Enc / LLM=300M/7B, Evaluation Protocol=zero-shot2025.06 | 72.6 | — | — | — | — | |
| InternVL2.5Size=7B, #Tokens=2562025.01 | 72 | — | — | — | — | |
| InternVL2.5#Frames=16-642026.02 | 72 | — | — | — | — | |
| LFS + Qwen3-VL-8BZero-shot=true2026.01 | 70.8 | — | — | — | — | |
| Qwen2.5-VL-72BZero-shot=true2026.01 | 70.4 | — | — | — | — | |
| Qwen2.5VLParams Enc / LLM=1B/7B, Evaluation Protocol=zero-shot2025.06 | 69.6 | — | — | — | — | |
| InternVL2Size=76B, #Tokens=2562025.01 | 69.6 | — | — | — | — | |
| Qwen3-VL-4BZero-shot=true2026.01 | 68.9 | — | — | — | — | |
| Qwen3-VL-8BZero-shot=true2026.01 | 68.7 | — | — | — | — | |
| PixelReasonser#Frames=162026.02 | 67.8 | — | — | — | — | |
| Weaver#Frames=128+1fps2026.02 | 67.7 | — | — | — | — | |
| Long-VILA-R1#Frames=5122026.02 | 67.6 | — | — | — | — | |
| InternVideo2-HDSize=7B, #Tokens=722025.01 | 67.2 | — | — | — | — | |
| InternVideo2Params=6B2025.03 | 67.2 | — | — | — | — | |
| Qwen2VLParams Enc / LLM=675M/7B, Evaluation Protocol=zero-shot2025.06 | 67 | — | — | — | — | |
| QwenVL2Size=7B2025.01 | 67 | — | — | — | — | |
| Qwen2 VL (7B)# Frames=2 fps (max 768)2024.10 | 67 | — | — | — | — | |
| LongVUSize=7B, #Tokens=642025.01 | 66.9 | — | — | — | — | |
| VideoChat-TPOSize=7B, #Tokens=642025.01 | 66.8 | — | — | — | — | |
| Weaver-SFT#Frames=128+1fps2026.02 | 66.5 | — | — | — | — | |
| InternVL2Size=8B, #Tokens=2562025.01 | 66.4 | — | — | — | — | |
| Qwen2.5-VL#Frames=1282026.02 | 66 | — | — | — | — | |
| Video-R1#Frames=642026.02 | 64.8 | — | — | — | — | |
| HICom (Ours)LLM Size=7B, #Frames=64, #Tokens=1328, inference_frames_sampling_32=true2025.03 | 64.7 | — | — | — | — | |
| GPT4-o2025.01 | 64.6 | — | — | — | — | |
| GPT4-o#Frames=1fps2026.02 | 64.6 | — | — | — | — | |
| FrameMind#Frames=322026.02 | 64.2 | — | — | — | — | |
| HICom (Ours)LLM Size=7B, #Frames=32, #Tokens=6802025.03 | 64.1 | — | — | — | — | |
| HICom (Ours)LLM Size=7B, #Frames=128, #Tokens=2624, inference_frames_sampling_32=true2025.03 | 64 | — | — | — | — | |
| TarsierLLM Size=7B, #Frames=16, #Tokens=23042025.03 | 62.6 | — | — | — | — | |
| VideoChat2-HDSize=7B, #Tokens=722025.01 | 62.3 | — | — | — | — | |
| VideoRFT#Frames=322026.02 | 62.1 | — | — | — | — | |
| VideoLLaMA2Size=72B, #Tokens=722025.01 | 62 | — | — | — | — | |
| VITED (Temporal Evidence Distillation)Params=7B, Base Model=LLaVA-Video Base2025.03 | 60.95 | — | — | — | — | |
| Baichuan-omni (7B)# Frames=1 fps (max 48)2024.10 | 60.9 | — | — | — | — | |
| Gemini-1.5-Pro2025.01 | 60.5 | — | — | — | — | |
| Gemini-1.5-Pro#Frames=1fps2026.02 | 60.5 | — | — | — | — | |
| VideoChat2-MistralLLM Size=7B, #Frames=16, #Tokens=15362025.03 | 60.4 | — | — | — | — | |
| LLaVA-Video (Video Instruction Tuning)Params=7B, Base Model=LLaVA-Video Base2025.03 | 59.55 | — | — | — | — | |
| LLaVA-Video (Chain-of-Thought)Params=7B, Base Model=LLaVA-Video Base2025.03 | 59.5 | — | — | — | — | |
| LLaVA-OneVisionSize=72B, #Tokens=1962025.01 | 59.4 | — | — | — | — | |
| LLaVA-VideoLLM Size=7B, #Frames=32, #Tokens=62722025.03 | 58.6 | — | — | — | — | |
| LLaVA-VideoParams=7B, Base Model=LLaVA-Video Base2025.03 | 58.6 | — | — | — | — | |
| VITED (Dense Caption Distillation)Params=7B, Base Model=LLaVA-Video Base2025.03 | 58.53 | — | — | — | — | |
| LLaVA-OneVisionSize=7B, #Tokens=1962025.01 | 56.7 | — | — | — | — | |
| LLaVA-OneVisionLLM Size=7B, #Frames=32, #Tokens=62722025.03 | 56.7 | — | — | — | — | |
| LLaVA-OneVision#Frames=322026.02 | 56.7 | — | — | — | — | |
| HICom (Ours)LLM Size=1.5B, #Frames=32, #Tokens=6802025.03 | 56.4 | — | — | — | — | |
| LLaVA-OneVisionParams=7B2025.03 | 55.91 | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=14B2024.07 | 54.9 | — | — | — | — | |
| VideoLLaMA2Size=7B, #Tokens=722025.01 | 54.6 | — | — | — | — | |
| VideoLLaMA 2 (7B)# Frames=162024.10 | 54.6 | — | — | — | — | |
| VideoLLaMA2LLM Size=7B, #Frames=16, #Tokens=11522025.03 | 54.6 | — | — | — | — | |
| mPLUG-Owl3Size=7B2025.01 | 54.5 | — | — | — | — | |
| VITA (8x7B)# Frames=1 fps (max 32)2024.10 | 53.4 | — | — | — | — | |
| LLaVA-NeXT-VideoSize=7B, #Tokens=1442025.01 | 53.1 | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=7B2024.07 | 53.1 | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=7B, Training Protocol=DPO2024.07 | 52.3 | — | — | — | — | |
| VideoChat2Size=7B2024.07 | 51.9 | — | — | — | — | |
| VideoChat2Fine-tuned=false2024.03 | 51.1 | — | — | — | — | |
| VideoChat2 (7B)# Frames=162024.10 | 51.1 | — | — | — | — | |
| VITED (Temporal Evidence Distillation)Params=7B, Base Model=TimeChat Base2025.03 | 50.46 | — | — | — | — | |
| VITED (Dense Caption Distillation)Params=7B, Base Model=TimeChat Base2025.03 | 50.12 | — | — | — | — | |
| VideoChat2 (our impl.)Fine-tuned=false, Implementation=Reproduced2024.03 | 49.75 | — | — | — | — | |
| LongLLaVASize=9B, #Tokens=1442025.01 | 49.1 | — | — | — | — | |
| HawkEyeFine-tuned=false2024.03 | 47.55 | — | — | — | — | |
| TimeChat (Video Instruction Tuning)Params=7B, Base Model=TimeChat Base2025.03 | 47.48 | — | — | — | — | |
| PLLAVALLM Size=7B, #Frames=16, #Tokens=23042025.03 | 46.6 | — | — | — | — | |
| LLaVA-NeXT-Video (7B)# Frames=322024.10 | 46.5 | — | — | — | — | |
| LLaVA-Next-VideoLLM Size=7B, #Frames=32, #Tokens=46082025.03 | 46.5 | — | — | — | — | |
| Chat-Univi-1.5LLM Size=7B, #Frames=64, #Tokens=4482025.03 | 45.9 | — | — | — | — | |
| LLaVA-NeXT-InterleaveSize=0.5B2024.07 | 45.6 | — | — | — | — | |
| LLaMA-3.2VParams=11B2025.03 | 44.72 | — | — | — | — | |
| GPT4-V2025.01 | 43.7 | — | — | — | — | |
| GPT 4V# Frames=-2024.10 | 43.7 | — | — | — | — | |
| GPT4-V#Frames=1fps2026.02 | 43.7 | — | — | — | — | |
| Video-LLaVALLM Size=7B, #Frames=8, #Tokens=20482025.03 | 43 | — | — | — | — | |
| LLaMA-VIDSize=7B, #Tokens=22025.01 | 41.9 | — | — | — | — | |
| LLaMA-VIDLLM Size=7B, #Frames=1fps, #Tokens=2tps2025.03 | 41.9 | — | — | — | — | |
| Video-LLaVA (7B)# Frames=82024.10 | 41 | — | — | — | — | |
| TimeChatFine-tuned=false2024.03 | 35.93 | — | — | — | — | |
| AnyGPT (8B)# Frames=482024.10 | 33.2 | — | — | — | — | |
| TimeChat (Chain-of-Thought)Params=7B, Base Model=TimeChat Base2025.03 | 22.05 | — | — | — | — | |
| TimeChatParams=7B, Base Model=TimeChat Base2025.03 | 17.08 | — | — | — | — | |
| Gemini-1.5Zero-shot=true2025.02 | — | 37.7 | — | — | — | |
| GPT-4VBackbone=GPT-4, Zero-shot=true2025.02 | — | 43.7 | — | — | — | |
| Idefics2Number of Parameters=8B2024.08 | — | 29.7 | — | — | — | |
| LLAVA-InterleaveNumber of Parameters=8B2024.08 | — | 53.1 | — | — | — | |
| LLAVA-OVBackbone=Qwen2-7B, Zero-shot=true2025.02 | — | 56.7 | 46 | 74.5 | 48 | |
| Long-Llava 9BBackbone=Long-Llava 9B, Zero-shot=true2025.02 | — | 49.1 | — | — | — | |
| LongVABackbone=Qwen2-7B, Zero-shot=true2025.02 | — | 51.3 | 49 | 53 | 42.5 | |
| Magma-8BBackbone=LLaMA3-8B, Zero-shot=true2025.02 | — | 59.4 | 65 | 79 | 55.5 | |
| Mantis-SigLIPNumber of Parameters=8B2024.08 | — | 50.2 | — | — | — | |
| mPLUG-Owl3Number of Parameters=8B2024.08 | — | 54.5 | — | — | — |