Video Question Answering on EgoSchema
82.2AccuracyA4VL
Evaluation Results
| Method | Links | |
|---|---|---|
| A4VL2026.03 | 82.2 | |
| LVAgent2026.03 | 78.4 | |
| Qwen2.5-VL-72BFrames=768, Inference Time=122.4s2025.06 | 77.9 | |
| GPT 4o# Frames=-2024.10 | 77.2 | |
| InternVL3-78BModel Size=78B2026.03 | 76.8 | |
| InternVL3.5-38BModel Size=38B2026.03 | 75.4 | |
| VisualClawBackbone=Gemini 3 Flash, mode=U-8+FullEvo (Guide)2026.06 | 73.6 | |
| Gemini 1.5 Pro2024.03 | 72.2 | |
| Gemini 1.5 ProFrames=1282026.01 | 72.2 | |
| GPT-4oFrames=384, Inference Time=134.4s2025.06 | 72.2 | |
| GPT-4oSource=Paper/Leaderboard2026.03 | 72.2 | |
| Gemini 1.5 ProBackbone=Gemini 1.5 Pro2026.06 | 72.2 | |
| VideoChat-A1Backbone=InternVL2.5-8B, Frames=35.9, Inference Time=14.7s2025.06 | 72.1 | |
| BIMBA-LLaVALLM=Qwen2-7B, Frames=1282025.03 | 71.14 | |
| Gemini-1.5-ProFrames=568, Inference Time=198.8s2025.06 | 71.1 | |
| Gemini 1.5ProSource=Paper/Leaderboard2026.03 | 71.1 | |
| VideoChat-A1Backbone=Qwen2.5-VL-7B, Frames=42.0, Inference Time=18.6s2025.06 | 70.7 | |
| QwenVL-2.5-72BModel Size=72B2026.03 | 70.7 | |
| GPT-5.2Encoding=Uniform-8, Variant=Plain2026.06 | 70.6 | |
| VideoChat-A1Backbone=InternVideo2.5-8B, Frames=41.3, Inference Time=28.4s2025.06 | 70.1 | |
| LLaVA-Video-72B-Qwen2Model Size=72B, Backbone=Qwen22026.03 | 69.4 | |
| Qwen2.5-VL-7B+TIR-FlowFrames=322026.01 | 69.2 | |
| VideoMindPalace2025.01 | 68.6 | |
| FullEvo (Guide)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 68.4 | |
| VisualClawBackbone=Gemini 3 Flash, mode=streaming FullEvo (Guide)2026.06 | 68.4 | |
| Flash-VstreamTotal Num of Token=115202026.04 | 68.2 | |
| Gemini 3 FlashEncoding=Cascade, Variant=+Evolve2026.06 | 68 | |
| FullEvo (Guide)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 68 | |
| LLaVA-Video-7B+TIR-FlowFrames=322026.01 | 67.8 | |
| LLoVi (GPT-4o)Backbone=GPT-4o2026.06 | 67.6 | |
| Qwen2.5-Omni2026.02 | 67.43 | |
| EgoAVU (LoRA)Fine-tuning Strategy=LoRA2026.02 | 67.34 | |
| InternVL3-8BNumber of sampled frames=322026.03 | 67.2 | |
| Gemini 3 FlashEncoding=Cascade, Variant=Seed2026.06 | 67.2 | |
| GPT-5.2Encoding=Cascade, Variant=+SkillMemCat2026.06 | 67.2 | |
| HINT InternVL3-8BNumber of sampled frames=32, Backbone=InternVL3-8B2026.03 | 67.1 | |
| Qwen2 VL (7B)# Frames=2 fps (max 768)2024.10 | 66.7 | |
| Qwen2.5-VL-7BFrames=512, Inference Time=24.3s2025.06 | 66.7 | |
| GPT-5.2Encoding=Cascade, Variant=Seed2026.06 | 66.6 | |
| EgoAVU (Full)Fine-tuning Strategy=Full2026.02 | 66.21 | |
| VideoTreeLLM Size=GPT-4, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 66.2 | |
| VideoTree2026.01 | 66.2 | |
| VideoTree2025.01 | 66.2 | |
| GPT-5.2Encoding=Cascade, Variant=+Evolve2026.06 | 66.2 | |
| InfiniPot-VFrames=7682026.01 | 65.8 | |
| Gemini-1.5-FlashFrames=1282026.01 | 65.7 | |
| Qwen2.5-VL-7BFrames=322026.01 | 65.6 | |
| FullEvo (Cat.)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 65.6 | |
| MMViR (w/o text)Modality=Image, Structure=Fine-grained, Segmentation Type=Clip-based Segmentation, Avg. Time (min)=0.82026.01 | 65.4 | |
| Gemini 3 FlashEncoding=Cascade, Variant=+SkillMemCat2026.06 | 65.2 | |
| QwenVL-2.5-32BModel Size=32B2026.03 | 64.8 | |
| FullEvo (Cat.)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 64.6 | |
| BOLTSource=Paper/Leaderboard2026.03 | 64 | |
| Qwen2-VL-onlineTotal Num of Token=115202026.04 | 64 | |
| GPT-5.2Encoding=Cascade, Variant=Plain2026.06 | 64 | |
| InternVideo-2.5-8BFrames=512, Inference Time=33.8s2025.06 | 63.9 | |
| VideoLLaMA2Train Model Size=72B, Train Data Size=13.6M, Computational Resources=32 × 80 GB A100s2026.06 | 63.9 | |
| VideoLLaMA3-7BFrames=1802026.01 | 63.3 | |
| Gemini 1.5 Pro# Frames=-2024.10 | 63.2 | |
| TASKERTrain Model Size=Training-free2026.06 | 63.1 | |
| LLaVA-OneVision-7B + FrameOracleFrames=64→82025.10 | 62.8 | |
| KangarooLLM=LLaMA2-8B, Frames=642025.03 | 62.7 | |
| HICom (Ours)LLM Size=7B, #Frames=128, #Tokens=2624, inference_frames_sampling_32=true2025.03 | 62.3 | |
| HICom (Ours)LLM Size=7B, #Frames=64, #Tokens=1328, inference_frames_sampling_32=true2025.03 | 62.2 | |
| LLaVA-OneVision-7B + BOLTFrames=1fps→82025.10 | 62.2 | |
| InternVL3.5-8BModel Size=8B2026.03 | 62 | |
| LLaVA-OneVision-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | 62 | |
| LLaVA-OneVision-7BFrames=82025.10 | 62 | |
| RandomModality=Image, Structure=Global2026.01 | 61.8 | |
| MMViRModality=Text+Image, Structure=Multi-grained, Segmentation Type=Clip-based Segmentation, Avg. Time (min)=36.82026.01 | 61.8 | |
| LLaVA-Video-7B-Qwen2Model Size=7B, Backbone=Qwen22026.03 | 61.8 | |
| POINTS-LongNum Frame=248+8, Token/Frame=8, Total Num of Token=32002026.04 | 61.6 | |
| Gemini 1.0 Ultra2024.03 | 61.5 | |
| LLoVi2025.01 | 61.2 | |
| VideoTreeLLM=GPT42025.03 | 61.1 | |
| OmniStream2026.03 | 60.9 | |
| QwenVL-2.5-7BModel Size=7B2026.03 | 60.7 | |
| POINTS-LongNum Frame=248+8, Token/Frame=16, Total Num of Token=52482026.04 | 60.7 | |
| Qwen2-VL-7B-InstructFrames=322026.01 | 60.6 | |
| Gemini 3 FlashEncoding=Uniform-8, Variant=Plain2026.06 | 60.6 | |
| HICom (Ours)LLM Size=7B, #Frames=32, #Tokens=6802025.03 | 60.5 | |
| UniformModality=Image, Structure=Global2026.01 | 60.4 | |
| BIMBA-LLAMALLM=LLaMA3.2-8B, Frames=642025.03 | 60.25 | |
| VideoChat2-HDViEncoder=InternVideo2_S3-1B, LLM=Mistral-7B2024.03 | 60.2 | |
| VideoAgentLLM Size=GPT-4, Vision Encoder=Unknown, Training Protocol=Training-free2024.07 | 60.2 | |
| MMViR (w/o img)Modality=Text, Structure=Multi-grained, Segmentation Type=Clip-based Segmentation, Avg. Time (min)=36.02026.01 | 60.2 | |
| VideoAgent2025.01 | 60.2 | |
| VideoAgentFrames=8.42025.10 | 60.2 | |
| VideoAgentBackbone=GPT-4 + LLM planner2026.06 | 60.2 | |
| LLaVA-OneVisionLLM Size=7B, #Frames=32, #Tokens=62722025.03 | 60.1 | |
| LLaVA-OneVisionLLM=Qwen2-7B, Frames=322025.03 | 60.1 | |
| LLaVA-OV-7BFLOPs (TB)=98.53, Total/Trainable Params=8.2B/-2025.03 | 60.1 | |
| LLaVA-onevision-7BFrames=322026.01 | 60.1 | |
| VideoChat2-HD-F16ViEncoder=InternVideo2_S3-1B, LLM=Mistral-7B, Frames=162024.03 | 60 | |
| IG-VLM2025.01 | 59.8 | |
| POINTS-LongNum Frame=504+8, Token/Frame=8, Total Num of Token=52482026.04 | 59.7 | |
| Qwen2.5-VL-7B + FrameOracleFrames=128→82025.10 | 59.5 | |
| POINTS1.5-8B-onlineNum Frame=64, Token/Frame=324, Total Num of Token=207362026.04 | 59.3 | |
| Baichuan-omni (7B)# Frames=1 fps (max 48)2024.10 | 58.8 | |
| Q2.5VL-7BTokens Retained Percentage=100%2025.03 | 58.8 |