Long-form Video Understanding on EgoSchema
72.2AccuracyGPT-4o
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o2024.12 | 72.2 | — | |
| GPT4-O2025.01 | 72.2 | — | |
| Gemini 1.5 pro#Frames=1 fps2026.01 | 69.32 | — | |
| LongVUSize=7B, # token/frame=64-1442024.12 | 67.6 | — | |
| Qwen2-VLSize=7B, # token/frame=*2024.12 | 66.7 | — | |
| Qwen2-VL-7B#Frames=642026.01 | 66.7 | — | |
| ST-SimDiff-128Input Frames=128, Token Retain Ratio (r)=50%2026.05 | 64.5 | — | |
| GPT-4o#Frames=642026.01 | 64.46 | — | |
| ST-SimDiff-128Input Frames=128, Token Retain Ratio (r)=30%2026.05 | 64.4 | — | |
| Qwen2.5-VL-128Input Frames=128, Token Retain Ratio (r)=100% (Full Performance)2026.05 | 63.9 | — | |
| FrameOracleFrame=64 → 15.6, Backbone=LLaVA-OneVision2025.10 | 63.4 | — | |
| Qwen2.5-VL-64Input Frames=64, Token Retain Ratio (r)=100% (Full Performance)2026.05 | 63 | — | |
| KangarooSize=8B, # token/frame=10242024.12 | 62.7 | — | |
| ST-SimDiff-64Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 62.7 | — | |
| ST-SimDiff-64Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 62.7 | — | |
| TimeChat-Online-7B#Frames=1 fps2026.01 | 61.9 | — | |
| Gemini-1.5-Pro2024.12 | 61.5 | — | |
| ReKVBase Model=LLaVA-OV-7B, #Frames=0.5 fps2026.01 | 60.7 | — | |
| HERMESBase Model=LLaVA-OV-7B, Memory Budget=4K tokens, #Frames=0.5 fps2026.01 | 60.29 | — | |
| HERMESBase Model=LLaVA-OV-7B, Memory Budget=6K tokens, #Frames=0.5 fps2026.01 | 60.23 | — | |
| LLaVA-OVSize=7B, # token/frame=1962024.12 | 60.1 | — | |
| InternVideo2Size=8B, # token/frame=962024.12 | 60 | — | |
| HERMESBase Model=Qwen2.5-VL-7B, Memory Budget=4K tokens, #Frames=1 fps2026.01 | 59.97 | — | |
| LLaVA-OV-7B#Frames=642026.01 | 59.93 | — | |
| PVC InternVL2Size=8B, # token/frame=642024.12 | 59.6 | — | |
| HERMESBase Model=Qwen2.5-VL-7B, Memory Budget=6K tokens, #Frames=1 fps2026.01 | 59.47 | — | |
| LLaVA-Octopus2025.01 | 59.2 | — | |
| Qwen2.5-VL-7B#Frames=1 fps2026.01 | 58.47 | — | |
| MovieChatFrame=512 → 64, Backbone=LLaVA-OneVision2025.10 | 57.8 | — | |
| LLaVA-VideoSize=7B, # token/frame=1692024.12 | 57.3 | — | |
| LLaVA-Video-7B#Frames=322026.01 | 57.3 | — | |
| GPT-4V2024.12 | 55.6 | — | |
| Dispider-7B#Frames=1 fps2026.01 | 55.6 | — | |
| GPT4-V2025.01 | 55.6 | — | |
| InternVL2Size=8B, # token/frame=2562024.12 | 55 | — | |
| Qwen2-VLSize=2B, # token/frame=*2024.12 | 54.9 | — | |
| VideoChat2-HD2025.01 | 54.4 | — | |
| NVILA-VideoBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=100% (Upper Bound)2026.05 | 52.9 | — | |
| FrameFusionBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 52.6 | — | |
| ST-SimDiffBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 52.5 | — | |
| VideoLLaMA2Size=7B, # token/frame=722024.12 | 51.7 | — | |
| VideoLLaMA22025.01 | 51.7 | — | |
| ST-SimDiffBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 51.7 | — | |
| PLLAVASize=7B, # token/frame=1442024.12 | 51.5 | — | |
| VideoChat2Size=7B, # token/frame=962024.12 | 51.4 | — | |
| FrameFusionBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 51.3 | — | |
| FasterVLMBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 50.5 | — | |
| VisionZipBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 50.3 | — | |
| LLaVA-OctopusTraining Data=same as Video-LLaVA [36]2025.01 | 50.2 | — | |
| FastVBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 50.2 | — | |
| TarsierSize=7B, # token/frame=5762024.12 | 49.9 | — | |
| PVC InternVL2Size=2B, # token/frame=642024.12 | 49.8 | — | |
| FastVBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 49.7 | — | |
| FasterVLMBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 49.3 | — | |
| VisionZipBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 48.9 | — | |
| PruMergeBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 48.9 | — | |
| PruMergeBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 47.5 | — | |
| InternVL2Size=2B, # token/frame=2562024.12 | 46.7 | — | |
| LLaVA-NeXT-Video2025.01 | 43.9 | — | |
| LangRepo-12BLLM=Mixtral [11]2026.02 | 41.2 | — | |
| SlowFocusLLM=Vicuna-7B, LoRA=✓2026.02 | 39.7 | — | |
| LLaMA-VIDTraining Data=same as Video-LLaVA [36]2025.01 | 38.5 | — | |
| Video-LLaVATraining Data=same as Video-LLaVA [36]2025.01 | 38.4 | — | |
| VamosLLM=GPT-42026.02 | 36.7 | — | |
| VideoLLaMA2Training Data=same as Video-LLaVA [36]2025.01 | 34.6 | — | |
| LLoVi-7BLLM=Llama2-7B [29]2026.02 | 34 | — | |
| InternVideoLoRA=✗2026.02 | 32.1 | — | |
| FrozenBiLMLLM=DeBERTa [8], LoRA=✗2026.02 | 26.9 | — | |
| VIOLETLoRA=✗2026.02 | 19.9 | — | |
| Claude Sonnet 4.5Model Type=Proprietary2026.06 | — | 73.1 | |
| Eagle2.5-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 72.2 | |
| Gemini 2.5 FlashModel Type=Proprietary2026.06 | — | 70.2 | |
| Gemini 2.5 ProModel Type=Proprietary2026.06 | — | 72.2 | |
| Gemini 3 ProModel Type=Proprietary2026.06 | — | 68.9 | |
| Gemini-1.5-FlashEvaluation Protocol=Zero-shot2025.07 | — | 65.7 | |
| Gemini-1.5-ProEvaluation Protocol=Zero-shot2025.07 | — | 71.2 | |
| GLM-4.1V-9BModel Type=Open-Weight, Parameters=9B2026.06 | — | 62.6 | |
| GPT-4oEvaluation Protocol=Zero-shot2025.07 | — | 72.2 | |
| GPT-5Model Type=Proprietary2026.06 | — | 75.6 | |
| GPT-5 miniModel Type=Proprietary2026.06 | — | 70.9 | |
| InternVideo2.5-7BModel Type=Open-Weight, Parameters=7B2026.06 | — | 63.9 | |
| InternVideo3Model Type=Open-Weight2026.06 | — | 76.6 | |
| InternVL3.5LLM=Qwen3-14B, Frames=16, Tokens=3.96B, Evaluation Protocol=Zero-shot2025.07 | — | 64.7 | |
| InternVL3.5-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 58.6 | |
| InternVL3.5-REGATELLM=Qwen3-14B, Frames=16, Tokens=2.32B (↓ 41.41%), Evaluation Protocol=Zero-shot2025.07 | — | 63.9 | |
| Keye-VL-1.5-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 56.3 | |
| LLaMA-VIDLLM=Llama-2-7B, Frames=1fps, Evaluation Protocol=Zero-shot2025.07 | — | 38.5 | |
| LLaVA-NeXT-VideoLLM=Vicuna-7B, Frames=32, Evaluation Protocol=Zero-shot2025.07 | — | 43.9 | |
| LLaVA-NeXT-VideoLLM=Qwen2-32B, Frames=32, Evaluation Protocol=Zero-shot2025.07 | — | 60.9 | |
| LLaVA-OneVisionLLM=Qwen2-7B, Frames=32, Evaluation Protocol=Zero-shot2025.07 | — | 60.1 | |
| LLaVA-Video-7BModel Type=Open-Weight, Parameters=7B2026.06 | — | 57.3 | |
| MiniCPM-V-4.5-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 49.6 | |
| Molmo2-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 62 | |
| Qwen2.5-VLLLM=Qwen2.5-7B, Evaluation Protocol=Zero-shot2025.07 | — | 65 | |
| Qwen3-VL-8BModel Type=Open-Weight, Parameters=8B2026.06 | — | 69.8 | |
| Video-LLaVALLM=Vicuna-7B, Frames=8, Evaluation Protocol=Zero-shot2025.07 | — | 38.4 | |
| VideoChat-Flash-7BModel Type=Open-Weight, Parameters=7B2026.06 | — | 51.3 | |
| VideoChat2LLM=Mistral-7B, Frames=16, Tokens=3.93B, Evaluation Protocol=Zero-shot2025.07 | — | 55.6 | |
| VideoChat2-REGATELLM=Mistral-7B, Frames=16, Tokens=2.22B (↓ 43.51%), Evaluation Protocol=Zero-shot2025.07 | — | 54.8 | |
| VideoLLaMA2LLM=Qwen2-7B, Frames=16, Tokens=83.82M, Evaluation Protocol=Zero-shot2025.07 | — | 58.2 |