Video Question Answering on NExT-QA Multi-choice
84.5AccuracyVideoLLaMA3-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoLLaMA3-7BMax #F=180, Max Res.=3842026.03 | 84.5 | |
| LLaVA-VideoLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 83.2 | |
| LLaVA-Video-7Bzero-shot=true2025.03 | 83.2 | |
| LLaVAction-7Bzero-shot=true2025.03 | 82.8 | |
| NVILA-8B-Video + AutoGazeMax #F=1024, Max Res.=35842026.03 | 82.8 | |
| NVILA-8B-VideoMax #F=256, Max Res.=4482026.03 | 82.2 | |
| LongVILA-R1-7BMax #F=8192, Max Res.=4482026.03 | 81.5 | |
| LongVILALLM Size=7B2024.08 | 80.7 | |
| LongVILA-7BMax #F=2048, Max Res.=3842026.03 | 80.7 | |
| VideoChat2-7BTotal Params=7.3B, Input Res.=224×224, Num Frames=16, Throughput=11.42025.03 | 79.5 | |
| LLAVA-OVLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 79.4 | |
| LLAVA-OVLLM Size=7B2024.08 | 79.4 | |
| LLaVA-OV-7Bzero-shot=true2025.03 | 79.4 | |
| LLaVA-OV-8BMax #F=32, Max Res.=3842026.03 | 79.4 | |
| Tarsier-34BMode=Zero-shot2024.06 | 79.2 | |
| InternVL2.5-2BTotal Params=2.2B, Input Res.=448×448, Num Frames=32, Throughput=21.82025.03 | 75.6 | |
| Mobile-VideoGPT-1.5BTotal Params=1.6B, Input Res.=224×224, Num Frames=16, Throughput=41.02025.03 | 73.7 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 73.6 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 73.6 | |
| TS-LLaVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 73.6 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 73.5 | |
| VideoTreeMode=Zero-shot2024.06 | 73.5 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 73.5 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 73.5 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 73.5 | |
| LLaVA-NeXT-INST-ITLLM=Qwen2-7B, Vision Encoder=SigLIP-SO4002024.12 | 73 | |
| DYTOLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 72.9 | |
| KTV-34B-denseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 72.7 | |
| KTV-34B-normalLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 72.3 | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 72 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 72 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 72 | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 72 | |
| Tarsier-7BMode=Zero-shot2024.06 | 71.6 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 71.3 | |
| VideoAgentMode=Zero-shot2024.06 | 71.3 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 71.3 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 71.3 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 71.3 | |
| KTV-34B-sparseLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 71.2 | |
| IG-VLM (LLaVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 70.9 | |
| IG-VLMMode=Zero-shot2024.06 | 70.9 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 70.9 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 70.9 | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 70.9 | |
| SF-LLaVA-7BLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 70.9 | |
| IG-VLMLLM Size=34B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 70.7 | |
| LLaVA-NeXT-INST-ITLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 70.2 | |
| MMICLbackbone=Instruct-FLAN-T5-XXL2023.09 | 68.8 | |
| LongVA-7Bzero-shot=true2025.03 | 68.3 | |
| LongVA-7BTotal Params=7.4B, Input Res.=224×224, Num Frames=8, Throughput=9.22025.03 | 68.3 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 67.7 | |
| LLoViMode=Zero-shot2024.06 | 67.7 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 67.7 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 67.7 | |
| LLoViLLM Size=GPT-3.5, Vision Encoder=Unknown, Training Strategy=Training-free2024.11 | 67.7 | |
| GPT-4ozero-shot=true2025.03 | 66.7 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 66.5 | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 66.5 | |
| MMICLbackbone=FLAN-T5-XL2023.09 | 66.17 | |
| KTV-7B-denseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=dense2026.02 | 65.8 | |
| DYTOLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 65.7 | |
| Mobile-VideoGPT-0.5BTotal Params=0.6B, Input Res.=224×224, Num Frames=16, Throughput=45.92025.03 | 65.4 | |
| MMICLbackbone=Instruct-FLAN-T5-XL2023.09 | 65.33 | |
| KTV-7B-normalLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=normal2026.02 | 65.1 | |
| MMICLbackbone=FLAN-T5-XXL2023.09 | 64.67 | |
| KTV-7B-sparseLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free, Variant=sparse2026.02 | 64.5 | |
| InstructBLIPbackbone=FLANT5-XXL2023.09 | 64.27 | |
| SF-LLaVA-7BLLM Size=7B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 64.2 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 64.2 | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 64.2 | |
| Gemini-1.5-Prozero-shot=true2025.03 | 64 | |
| SF-LLaVA-7BLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 64 | |
| IG-VLM (LLaVA-v1.6)LLM Size=7B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 63.1 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 63.1 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 63.1 | |
| M3LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 63.1 | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.11 | 63.1 | |
| IG-VLMLLM Size=7B, Vis Encoder=CLIP-L, Training Regime=Training-Free2026.02 | 63.1 | |
| BLIP-2backbone=FLANT5-XXL2023.09 | 61.97 | |
| BLIP-2backbone=FLANT5-XL2023.09 | 61.73 | |
| Flash-VStreamLLM Size=7B2024.08 | 61.6 | |
| Gemini-1.5-Flashzero-shot=true2025.03 | 61.6 | |
| GPT-4Vzero-shot=true2025.03 | 61.3 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training Protocol=SFT2024.07 | 61 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 61 | |
| DeepStack-LLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Video-trained2024.11 | 61 | |
| DeepStack-LLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 61 | |
| LangRepoMode=Zero-shot2024.06 | 60.9 | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training Protocol=SFT2024.07 | 60.7 | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 60.7 | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 60.7 | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training Strategy=Video-trained2024.11 | 60.5 | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training Strategy=Video-trained2024.11 | 60.5 | |
| LLaVA-NeXTLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large, reproduced=true2024.12 | 58.4 | |
| Full ModelSparsity Ratio=0%, Base Model=LLaVA-OneVision2025.04 | 58.4 | |
| LLaVA-OneVision-0.5BTotal Params=1.0B, Input Res.=384×384, Num Frames=32, Throughput=22.72025.03 | 57.2 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training Protocol=SFT2024.07 | 54.8 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 54.8 | |
| MovieChat+LLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=Video-trained2024.11 | 54.8 |