Video Question Answering on NEXT-QA
85.5Overall AccuracyLinVT-Qwen2-VL
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| LinVT-Qwen2-VLSize=7B2024.12 | 85.5 | — | — | — | — | — | — | — | |
| LLaVA-Video (Chain-of-Thought)Params=7B, Base Model=LLaVA-Video Base2025.03 | 84.61 | — | — | — | — | — | — | — | |
| VITED (Temporal Evidence Distillation)Params=7B, Base Model=LLaVA-Video Base2025.03 | 84.13 | — | — | — | — | — | — | — | |
| LLaVA-Video (Video Instruction Tuning)Params=7B, Base Model=LLaVA-Video Base2025.03 | 83.93 | — | — | — | — | — | — | — | |
| VITED (Dense Caption Distillation)Params=7B, Base Model=LLaVA-Video Base2025.03 | 83.91 | — | — | — | — | — | — | — | |
| LLaVA-VideoSize=7B, # token/frame=1692024.12 | 83.2 | — | — | — | — | — | — | — | |
| LLaVA-VideoParams=7B, Base Model=LLaVA-Video Base2025.03 | 83.2 | — | — | — | — | — | — | — | |
| PVC InternVL2Size=8B, # token/frame=642024.12 | 82 | — | — | — | — | — | — | — | |
| Oryx MLLMSize=7B, # token/frame=*2024.12 | 81.9 | — | — | — | — | — | — | — | |
| LinVT-InternVL2Size=8B2024.12 | 81.9 | — | — | — | — | — | — | — | |
| CoPE-VideoLM2026.02 | 81.8 | — | — | — | — | — | — | — | |
| LinVT-MolmoSize=7B2024.12 | 81.4 | — | — | — | — | — | — | — | |
| LLaVA-Scissor2026.02 | 81.2 | — | — | — | — | — | — | — | |
| FastV2026.02 | 81.1 | — | — | — | — | — | — | — | |
| DyCoke2026.02 | 81.1 | — | — | — | — | — | — | — | |
| PLLaVA2026.02 | 81 | — | — | — | — | — | — | — | |
| Magma-8BBackbone=LLaMA3-8B, Zero-shot=true2025.02 | 80.9 | — | — | — | — | — | — | — | |
| LinVT-BLIP-3Size=4B2024.12 | 80.1 | — | — | — | — | — | — | — | |
| PAVE-7B (w/ video feature)FLOPs (TB)=98.63, Total/Trainable Params=8.2B/170.5M2025.03 | 79.6 | — | — | — | — | — | — | — | |
| VideoChat2-HDSize=7B2024.12 | 79.5 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 32 frames + BOLTLLM Size=7B, Frames=322025.03 | 79.5 | — | — | — | — | — | — | — | |
| LLaVA-OVSize=7B, # token/frame=1962024.12 | 79.4 | — | — | — | — | — | — | — | |
| LLAVA-OVBackbone=Qwen2-7B, Zero-shot=true2025.02 | 79.4 | — | — | — | — | — | — | — | |
| LLaVA-OneVisionParams=7B2025.03 | 79.4 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 32 framesLLM Size=7B, Frames=322025.03 | 79.4 | — | — | — | — | — | — | — | |
| LLaVA-OV-7BFLOPs (TB)=98.53, Total/Trainable Params=8.2B/-2025.03 | 79.4 | — | — | — | — | — | — | — | |
| mPLUG-Owl3Number of Parameters=8B2024.08 | 78.6 | — | — | — | — | — | — | — | |
| VisionZip2026.02 | 78.5 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 16 frames + BOLTLLM Size=7B, Frames=162025.03 | 78.3 | — | — | — | — | — | — | — | |
| LLAVA-InterleaveNumber of Parameters=8B2024.08 | 78.2 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 16 framesLLM Size=7B, Frames=162025.03 | 78.1 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 8 framesLLM Size=7B, Frames=82025.03 | 77.4 | — | — | — | — | — | — | — | |
| LLaVA-OneVision 8 frames + BOLTLLM Size=7B, Frames=82025.03 | 77.4 | — | — | — | — | — | — | — | |
| Vamos2023.11 | 77.3 | 81.7 | 75.3 | 77.2 | — | — | — | — | |
| BLIP-3-VideoSize=4B, # token/frame=162024.12 | 77.1 | — | — | — | — | — | — | — | |
| LinVT-AquilaSize=2B2024.12 | 76.6 | — | — | — | — | — | — | — | |
| LLAMA-VQA-33Bparameters=33B2023.11 | 75.5 | 78.8 | 72.6 | 76.2 | — | — | — | — | |
| Frame-VoyagerLLM Size=8B2025.03 | 73.9 | — | — | — | — | — | — | — | |
| SeViLAadditional supervision=true2023.11 | 73.8 | 81.3 | 69.4 | 74.2 | — | — | — | — | |
| SeViLAzero-shot=false2023.12 | 73.8 | — | — | — | — | — | — | — | |
| SeViLAParams=4B2025.03 | 73.8 | — | — | — | — | — | — | — | |
| VITED (Temporal Evidence Distillation)Params=7B, Base Model=TimeChat Base2025.03 | 73.42 | — | — | — | — | — | — | — | |
| PVC InternVL2Size=2B, # token/frame=642024.12 | 73.4 | — | — | — | — | — | — | — | |
| LLAMA-VQA-7Bparameters=7B2023.11 | 72 | 75.8 | 69.2 | 72.7 | — | — | — | — | |
| VITED (Dense Caption Distillation)Params=7B, Base Model=TimeChat Base2025.03 | 71.94 | — | — | — | — | — | — | — | |
| TarsierSize=7B, # token/frame=5762024.12 | 71.6 | — | — | — | — | — | — | — | |
| LinVT-MiphaSize=1.6B2024.12 | 71.1 | — | — | — | — | — | — | — | |
| TimeChat (Video Instruction Tuning)Params=7B, Base Model=TimeChat Base2025.03 | 71.05 | — | — | — | — | — | — | — | |
| IXC-2.5Size=7B, # token/frame=4002024.12 | 71 | — | — | — | — | — | — | — | |
| QwenVL 2.5-7BCategory=VLMs/Multimodal foundation approaches2025.08 | 70.75 | — | — | — | — | — | 59.5 | 70.73 | |
| LLaVA-NeXT-VideoSize=7B2024.12 | 70.2 | — | — | — | — | — | — | — | |
| BLIP-22023.11 | 70.1 | 80.1 | 65.2 | 70.1 | — | — | — | — | |
| GPT4oCategory=VLMs/Multimodal foundation approaches2025.08 | 70 | — | — | — | — | — | 56.72 | 58 | |
| LongVABackbone=Qwen2-7B, Zero-shot=true2025.02 | 69.3 | — | — | — | — | — | — | — | |
| VideoChat2Number of Parameters=8B2024.08 | 68.6 | — | — | — | — | — | — | — | |
| LongVASize=7B, # token/frame=1442024.12 | 68.3 | — | — | — | — | — | — | — | |
| LongVAParams=7B2025.03 | 68.3 | — | — | — | — | — | — | — | |
| LLaMA-3.2VParams=11B2025.03 | 67.58 | — | — | — | — | — | — | — | |
| ATPVideo-language pretraining=false2023.12 | 65.8 | 50.2 | 53.1 | — | — | — | — | — | |
| OursCategory=VLMs/Multimodal foundation approaches2025.08 | 63.95 | — | — | — | — | — | 69.26 | 71.22 | |
| InternVideo2Params=6B2025.03 | 63.4 | — | — | — | — | — | — | — | |
| RTQVideo-language pretraining=false2023.12 | 63.2 | 75.6 | 59.6 | 61.4 | — | — | — | — | |
| Intern Video2023.11 | 63.2 | 75.8 | 58.5 | 62.5 | — | — | — | — | |
| HiTeA2023.11 | 63.1 | 75.6 | 58.3 | 62.4 | — | — | — | — | |
| BLIPv2 ViTG FlanT5xxlzero-shot=true, vision encoder=ViTG, LLM=FlanT5xxl, number of frames=42023.09 | 62.4 | — | — | — | — | — | — | — | |
| HiTeAVideo-language pretraining=true2023.12 | 62.4 | 75.5 | 58.7 | 60.6 | — | — | — | — | |
| DeepStack-L-7Bzero-shot=true2024.06 | 61 | 69.4 | 55.5 | 61.9 | — | — | — | — | |
| VILA 1.5-3BCategory=VLMs/Multimodal foundation approaches2025.08 | 60.23 | — | — | — | — | — | 65.05 | 67.2 | |
| VideoChat2Category=VLMs/Multimodal foundation approaches2025.08 | 60 | — | — | — | — | — | 40.45 | 48.5 | |
| COVGTVideo-language pretraining=true2023.12 | 59.7 | 68.4 | 58 | 58 | — | — | — | — | |
| LLaVA-1.5-7Bzero-shot=true2024.06 | 59.6 | 68.9 | 55.5 | 59.5 | — | — | — | — | |
| COVGTVideo-language pretraining=false2023.12 | 59.4 | 66.8 | 57 | 58.5 | — | — | — | — | |
| VFCEvaluation Protocol=Fine-Tuned2023.04 | 58.6 | 72.8 | 53.3 | 57.6 | — | — | — | — | |
| AnyMAL-Image 70Bzero-shot=true, vision encoder=ViT-G, LLM size=70B, number of frames=42023.09 | 57.6 | — | — | — | — | — | — | — | |
| OneLLM-7Bzero-shot=true2023.12 | 57.3 | — | — | — | — | — | — | — | |
| LLaVA-OV-0.5BFLOPs (TB)=8.01, Total/Trainable Params=0.9B/-2025.03 | 57.2 | — | — | — | — | — | — | — | |
| PAVE-0.5B (w/ video feature)FLOPs (TB)=8.08, Total/Trainable Params=0.9B/41.4M2025.03 | 56.1 | — | — | — | — | — | — | — | |
| VGTEvaluation Protocol=Fine-Tuned2023.04 | 55 | 64.1 | 55.1 | 52.3 | — | — | — | — | |
| KangarooSize=8B, # token/frame=10242024.12 | 54.8 | — | — | — | — | — | — | — | |
| MISTCategory=Semi-traditional approaches2025.08 | 54.79 | — | — | — | — | — | 57.36 | 64.04 | |
| TAATPEvaluation Protocol=Fine-Tuned2023.04 | 54.3 | 66.8 | 50.2 | 53.1 | — | — | — | — | |
| ATP2023.11 | 54.3 | 66.8 | 50.2 | 53.1 | — | — | — | — | |
| VCSRCategory=Causal modeling approaches2025.08 | 53 | — | — | — | — | — | — | — | |
| JustAskzero-shot=false2023.12 | 52.3 | — | — | — | — | — | — | — | |
| HQGAVideo-language pretraining=false2023.12 | 51.8 | 59.4 | 52.3 | 49 | — | — | — | — | |
| HGQAzero-shot=false2023.12 | 51.8 | — | — | — | — | — | — | — | |
| DeepSeek-VL2Category=VLMs/Multimodal foundation approaches2025.08 | 51.55 | — | — | — | — | — | 41.92 | 51.95 | |
| VFCEvaluation Protocol=Zero-Shot2023.04 | 51.5 | 64.1 | 45.4 | 51.6 | — | — | — | — | |
| Temp[ATP]Evaluation Protocol=Fine-Tuned2023.04 | 51.5 | 65 | 49.3 | 48.6 | — | — | — | — | |
| Video-LlavaBackbone=Vicuna-7B, Zero-shot=true2025.02 | 51.4 | — | — | — | — | — | — | — | |
| IGVVideo-language pretraining=false2023.12 | 51.3 | 59.6 | 51.7 | 48.6 | — | — | — | — | |
| AnyMAL-Video 70Bzero-shot=true, vision encoder=Internvideo, LLM size=70B, number of frames=82023.09 | 50.6 | — | — | — | — | — | — | — | |
| TimeChatSize=7B2024.12 | 50.6 | — | — | — | — | — | — | — | |
| HGAEvaluation Protocol=Fine-Tuned, Additional features=Uses additional motion features2023.04 | 49.7 | 59.3 | 50.7 | 46.3 | — | — | — | — | |
| ATPEvaluation Protocol=Fine-Tuned2023.04 | 49.2 | 58.9 | 46.7 | 48.3 | — | — | — | — | |
| MCR+HCRNCategory=Causal modeling approaches2025.08 | 49.2 | — | — | — | — | — | — | — | |
| Internvideozero-shot=true, number of frames=82023.09 | 49.1 | — | — | — | — | — | — | — | |
| InternVideozero-shot=true2023.12 | 49.1 | — | — | — | — | — | — | — | |
| AnyMAL-Image 13Bzero-shot=true, vision encoder=ViT-G, LLM size=13B, number of frames=42023.09 | 47.9 | — | — | — | — | — | — | — | |
| AnyMAL-13Bzero-shot=true2023.12 | 47.9 | — | — | — | — | — | — | — |