Video Question Answering on EgoSchema subset
81AccuracyVideoHV-Agent
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoHV-Agentmode=Zero-Shot2026.03 | 81 | |
| VideoAgent2mode=Zero-Shot2026.03 | 80.6 | |
| VideoMultiAgentsmode=Zero-shot2025.04 | 75.4 | |
| VideoMultiAgentsmode=Zero-Shot2026.03 | 75.4 | |
| ProVCALLM/MLLM=GPT-4o2026.04 | 74.2 | |
| InternVL-3 + A.I.R.VLM Size=8B, #Frames=≤ 322025.10 | 72.2 | |
| Lifelong Memorymode=Zero-shot2025.04 | 72 | |
| LifelongMemorymode=Zero-Shot2026.03 | 72 | |
| InternVL-3VLM Size=8B, #Frames=322025.10 | 71.6 | |
| InternVL-3 + MDP3VLM Size=8B, #Frames=322025.10 | 70 | |
| AKEYS(M)LLM=GPT-4o2025.03 | 68.6 | |
| Tarsiermode=Zero-shot2025.04 | 68.6 | |
| Tarsiermode=Zero-Shot2026.03 | 68.6 | |
| LVNet(M)LLM=GPT-4o2025.03 | 68.2 | |
| LVNetmode=Zero-shot2025.04 | 68.2 | |
| LVNet(M)LLM=GPT-4o2024.05 | 68.2 | |
| LVNetmode=Zero-Shot2026.03 | 68.2 | |
| LVNetLLM/MLLM=GPT-4o2026.04 | 68.2 | |
| AKEYS(M)LLM=GPT-42025.03 | 68 | |
| Qwen2-VL-InstructLLM=Qwen2-7B, Vision Encoder=DFN-CLIP-H2024.12 | 66.7 | |
| T*VLM Size=7B, #Frames=82025.10 | 66.6 | |
| DrVideoVLM Size=GPT42025.10 | 66.4 | |
| DrVideoLLM/MLLM=GPT-42026.04 | 66.4 | |
| LangRepo(M)LLM=Mixtral-8x7B2025.03 | 66.2 | |
| VideoTree(M)LLM=GPT-42025.03 | 66.2 | |
| VideoTreemode=Zero-shot2025.04 | 66.2 | |
| LangRepo(M)LLM=Mixtral-8x7B2024.05 | 66.2 | |
| VIDEOTREE(M)LLM=GPT-42024.05 | 66.2 | |
| VideoTreemode=Zero-Shot2026.03 | 66.2 | |
| VideoTreeVLM Size=GPT42025.10 | 66.2 | |
| LangRepoLLM/MLLM=Mixtral-8×7B2026.04 | 66.2 | |
| VideoTreeLLM/MLLM=GPT-42026.04 | 66.2 | |
| Hu et al. (2025)VLM Size=8.5B, #Frames=322025.10 | 65.9 | |
| LifelongMemory(M)LLM=GPT-42025.03 | 64.1 | |
| LifelongMemory(M)LLM=GPT-42024.05 | 64.1 | |
| LLaVA-OneVision 32 frames + BOLTLLM Size=7B, Training Free=true, Frames=322025.03 | 64 | |
| LLaVA-OneVision + BOLTVLM Size=7B, #Frames=322025.10 | 64 | |
| VideoAgentcitation=[9], (M)LLM=GPT-42024.05 | 63.8 | |
| VideoChat2LLM Size=7B, Training Free=false2025.03 | 63.6 | |
| LLaVA-OneVision + A.I.R.VLM Size=7B, #Frames=≤ 322025.10 | 63.2 | |
| MI-PrunerBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 63 | |
| VideoAgent [6](M)LLM=GPT-42025.03 | 62.8 | |
| VideoAgentLLM/MLLM=GPT-4, Reference=[28]2026.04 | 62.8 | |
| QwenVL-2.5 + A.I.R.VLM Size=7B, #Frames=≤ 322025.10 | 62.4 | |
| LLaVA-OneVision 8 frames + BOLTLLM Size=7B, Training Free=true, Frames=82025.03 | 62.2 | |
| LLaVA-OneVision 32 framesLLM Size=7B, Training Free=false, Frames=322025.03 | 62.2 | |
| LLaVA-OneVision 8 framesLLM Size=7B, Training Free=false, Frames=82025.03 | 62 | |
| LLaVA-OneVision 16 frames + BOLTLLM Size=7B, Training Free=true, Frames=162025.03 | 61.8 | |
| LLaVA-OneVisionVLM Size=7B, #Frames=322025.10 | 61.8 | |
| QwenVL-2.5 + MDP3VLM Size=7B, #Frames=322025.10 | 61.6 | |
| LLaVA-OneVision 16 framesLLM Size=7B, Training Free=false, Frames=162025.03 | 61.4 | |
| LLoVi(M)LLM=GPT-42025.03 | 61.2 | |
| LLoVi(M)LLM=GPT-42024.05 | 61.2 | |
| LLoViLLM/MLLM=GPT-42026.04 | 61.2 | |
| EchoPruneBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 61.2 | |
| RandomBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 61 | |
| FlashVIDBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 61 | |
| LLaVA-OneVision + MDP3VLM Size=7B, #Frames=322025.10 | 60.8 | |
| Qwen2.5VL-7BBackbone=Qwen2.5VL-7B, Frames / Pruning Configuration=F32 (1×) / 100%2026.05 | 60.6 | |
| MVU(M)LLM=Mistral-13B2025.03 | 60.3 | |
| MVU(M)LLM=Mistral-13B2024.05 | 60.3 | |
| MVUVLM Size=13B, #Frames=162025.10 | 60.3 | |
| MVULLM/MLLM=Mistral-13B2026.04 | 60.3 | |
| VideoAgent [38](M)LLM=GPT-42025.03 | 60.2 | |
| VideoAgentcitation=[67], (M)LLM=GPT-42024.05 | 60.2 | |
| VideoAgentmode=Zero-Shot2026.03 | 60.2 | |
| VideoAgentVLM Size=GPT4, #Frames=1FPS2025.10 | 60.2 | |
| VideoAgentLLM/MLLM=GPT-4, Reference=[4]2026.04 | 60.2 | |
| LLaVAOneVision-7BTraining Mode=SFT, Video Data=true, Model Size=7B2024.09 | 60.1 | |
| LLAVA-OVLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 60.1 | |
| IG-VLM(M)LLM=GPT-4V2025.03 | 59.8 | |
| IG-VLM(M)LLM=GPT-4V2024.05 | 59.8 | |
| IG-VLMLLM/MLLM=GPT-4V2026.04 | 59.8 | |
| QwenVL-2.5VLM Size=7B, #Frames=322025.10 | 59.4 | |
| HCQAmode=Zero-shot2025.04 | 58.8 | |
| HCQAmode=Zero-Shot2026.03 | 58.8 | |
| LLaVA-NeXT-INST-ITLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 57.8 | |
| TS-LLAVAmode=Zero-Shot2026.03 | 57.8 | |
| LLoVi(M)LLM=GPT-3.52024.05 | 57.6 | |
| LLaVA-VideoLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 57.3 | |
| Vamos (GPT-4o)Input Type=caption, LLM=GPT-4o, Zero-shot=true2023.11 | 57.2 | |
| MM1.5-Video-7BTraining Mode=SFT, Video Data=true, Model Size=7B2024.09 | 57.2 | |
| ProViQ(M)LLM=GPT-3.52025.03 | 57.1 | |
| ProViQ(M)LLM=GPT-3.52024.05 | 57.1 | |
| FlashVIDBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 56.2 | |
| MI-PrunerBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 55.8 | |
| EchoPruneBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 55.4 | |
| RandomBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F160 (5×) / 20%2026.05 | 55.2 | |
| Qwen2.5VL-3BBackbone=Qwen2.5VL-3B, Frames / Pruning Configuration=F32 (1×) / 100%2026.05 | 53.8 | |
| VILA-1.5 + Frame-VoyagerVLM Size=8B, #Frames=82025.10 | 53.6 | |
| VILA-1.5 + A.I.R.VLM Size=8B, #Frames=82025.10 | 53.6 | |
| VILA-1.5VLM Size=8B, #Frames=82025.10 | 52.8 | |
| MM1.5-Video-3BTraining Mode=SFT, Video Data=true, Model Size=3B2024.09 | 52.4 | |
| Video-LLaMA2-7BTraining Mode=SFT, Video Data=true, Model Size=7B2024.09 | 51.7 | |
| Vamos (GPT-4)Input Type=caption, LLM=GPT-4, Zero-shot=true2023.11 | 51.2 | |
| Vamos(M)LLM=GPT-42025.03 | 51.2 | |
| Vamos(M)LLM=GPT-42024.05 | 51.2 | |
| MM1.5-Video-1BTraining Mode=SFT, Video Data=true, Model Size=1B2024.09 | 51 | |
| VILA-1.5 + MDP3VLM Size=8B, #Frames=82025.10 | 51 | |
| LLaVA-NeXT-INST-ITLLM=Qwen2-7B, Vision Encoder=SigLIP-SO4002024.12 | 50.4 |