Video Question-Answering on LongVideoBench
77.6AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gemini-2.5-ProFrames=-2026.03 | 77.6 | — | — | — | — | — | — | — | — | — | — | |
| Seed1.5-VLFrames=-2026.03 | 74 | — | — | — | — | — | — | — | — | — | — | |
| A4VL2026.03 | 72.2 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=72B, #Tokens=1962025.01 | 68 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8BReasoning Mode=None, Reproduced=true2026.01 | 67.6 | — | 2.2 | — | — | — | — | — | — | — | — | |
| VideoAuto-R1Reasoning Mode=AutoThink, Backbone=Qwen3-VL-8B2026.01 | 67.4 | 20 | 52 | — | — | — | — | — | — | — | — | |
| ToolMergeAnswerer model=Qwen3-VL, Frame budget (K)=322026.05 | 67.4 | — | — | — | — | — | — | — | — | — | — | |
| LVAgent2026.03 | 66.9 | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oFrames=-2026.03 | 66.7 | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oFrames=384, Inference Time=134.4s2025.06 | 66.7 | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o(0513)Model Type=Closed-Source Model2025.06 | 66.7 | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oSource=Paper/Leaderboard2026.03 | 66.7 | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3-78BModel Type=Open-Source 72B-78B Model2025.06 | 65.7 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=InternVideo2.5-8B, Frames=41.3, Inference Time=28.4s2025.06 | 65.4 | — | — | — | — | — | — | — | — | — | — | |
| VideoRAG-72BModel Type=Agent Based Model2025.06 | 65.4 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=InternVideo2.5-8B2025.06 | 65.4 | — | — | — | — | — | — | — | — | — | — | |
| VideoRAG-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | 65.4 | — | — | — | — | — | — | — | — | — | — | |
| ToolMergeAnswerer model=GPT-4o, Frame budget (K)=322026.05 | 65.3 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=InternVL2.5-8B, Frames=35.9, Inference Time=14.7s2025.06 | 65.2 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=InternVL2.5-8B2025.06 | 65.2 | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-QAnswerer model=Qwen3-VL, Frame budget (K)=322026.05 | 65.1 | — | — | — | — | — | — | — | — | — | — | |
| BOLT (CVPR 2025)Answerer model=Qwen3-VL, Frame budget (K)=322026.05 | 65 | — | — | — | — | — | — | — | — | — | — | |
| LLAVA-Video-72BModel Type=Open-Source 72B-78B Model2025.06 | 64.9 | — | — | — | — | — | — | — | — | — | — | |
| WFS (CVPR 2026)Answerer model=Qwen3-VL, Frame budget (K)=322026.05 | 64.9 | — | — | — | — | — | — | — | — | — | — | |
| WFS (CVPR 2026)Answerer model=GPT-4o, Frame budget (K)=322026.05 | 64.5 | — | — | — | — | — | — | — | — | — | — | |
| UniformAnswerer model=GPT-4o, Frame budget (K)=322026.05 | 64.4 | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen3-VL-8B, Retention Ratio R=100%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-FlashSize=7B, #Tokens=162025.01 | 64.2 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=Qwen2.5-VL-7B, Frames=42.0, Inference Time=18.6s2025.06 | 64.2 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-A1Backbone=Qwen2.5-VL-7B2025.06 | 64.2 | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro2025.01 | 64 | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-ProFrames=568, Inference Time=198.8s2025.06 | 64 | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 ProModel Type=Closed-Source Model2025.06 | 64 | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5ProSource=Paper/Leaderboard2026.03 | 64 | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-QAnswerer model=GPT-4o, Frame budget (K)=322026.05 | 63.9 | — | — | — | — | — | — | — | — | — | — | |
| UniformAnswerer model=Qwen3-VL, Frame budget (K)=322026.05 | 63.7 | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2.5-78BModel Type=Open-Source 72B-78B Model2025.06 | 63.6 | — | — | — | — | — | — | — | — | — | — | |
| AKS (CVPR 2025)Answerer model=Qwen3-VL, Frame budget (K)=322026.05 | 63.3 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-72BModel Type=Open-Source 72B-78B Model2025.06 | 63.2 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | 63.2 | — | — | — | — | — | — | — | — | — | — | |
| BOLT (CVPR 2025)Answerer model=GPT-4o, Frame budget (K)=322026.05 | 63.2 | — | — | — | — | — | — | — | — | — | — | |
| Aria-25.3BModel Size=25.3B, Source=Paper/Leaderboard2026.03 | 63 | — | — | — | — | — | — | — | — | — | — | |
| LIF (NeurIPS 2025)Answerer model=Qwen3-VL, Frame budget (K)=322026.05 | 62.8 | — | — | — | — | — | — | — | — | — | — | |
| LIF (NeurIPS 2025)Answerer model=GPT-4o, Frame budget (K)=322026.05 | 62.8 | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8BFrames=-2026.03 | 62.5 | — | — | — | — | — | — | — | — | — | — | |
| AKS (CVPR 2025)Answerer model=GPT-4o, Frame budget (K)=322026.05 | 62.3 | — | — | — | — | — | — | — | — | — | — | |
| ToMeBackbone=Qwen3-VL-8B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 62 | — | — | — | — | — | — | — | — | — | — | |
| MemoryCard (MiniCPM-V-4.5)LLM Size=8B, #Frames=4+ 8+ 322026.06 | 62 | — | — | — | — | — | — | — | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Retention Ratio R=22.9%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.9 | — | — | — | — | — | — | — | — | — | — | |
| ToolMergeAnswerer model=Qwen3-VL, Frame budget (K)=82026.05 | 61.8 | — | — | — | — | — | — | — | — | — | — | |
| ToMeBackbone=Qwen2.5-VL-7B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.6 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-InstructFrames=642026.03 | 61.5 | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-R1.5Reasoning Mode=Think-Only2026.01 | 61.4 | — | 133 | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen2.5-VL-7B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| Random DropBackbone=Qwen3-VL-8B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen3-VL-8B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| ToolMergeAnswerer model=GPT-4o, Frame budget (K)=82026.05 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| Random DropBackbone=Qwen2.5-VL-7B, Retention Ratio R=25.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 61.2 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-7B-Qwen2Model Size=7B, Backbone=Qwen22026.03 | 61.1 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BReasoning Mode=None, Reproduced=true2026.01 | 60.9 | — | 3 | — | — | — | — | — | — | — | — | |
| FixedScaleBackbone=Qwen2.5-VL-7B, Retention Ratio R=12.3%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 60.9 | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-4BFrames=-2026.03 | 60.8 | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-QAnswerer model=Qwen3-VL, Frame budget (K)=82026.05 | 60.8 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-72B-Qwen2Model Size=72B, Backbone=Qwen22026.03 | 60.7 | — | — | — | — | — | — | — | — | — | — | |
| InternVideo2.5 (InternVL2.5+LRC)Size=7B, #Tokens=162025.01 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| InternVideo-2.5-8BFrames=512, Inference Time=33.8s2025.06 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| InternVideo-2.5-8BModel Type=Open-Source 7B-8B Model2025.06 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| Video-o3 (SFT+RL)Size=7B2026.01 | 60.5 | — | — | — | — | — | — | — | — | — | — | |
| VideoAuto-R1Reasoning Mode=AutoThink, Backbone=Qwen2.5-VL-7B2026.01 | 60.5 | 39 | 44 | — | — | — | — | — | — | — | — | |
| WFS (CVPR 2026)Answerer model=Qwen3-VL, Frame budget (K)=82026.05 | 60.4 | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Retention Ratio R=100%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 60.3 | — | — | — | — | — | — | — | — | — | — | |
| ResAdaptBackbone=Qwen2.5-VL-7B, Retention Ratio R=22.9%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 60.2 | — | — | — | — | — | — | — | — | — | — | |
| VideoAuto-R1 + ResAdaptBackbone=Qwen2.5-VL-7B, Retention Ratio R=23.8%, Reasoning (CoT)=true, Frames=128 Frames2026.03 | 60.2 | — | — | — | — | — | — | — | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Retention Ratio R=11.1%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 60.2 | — | — | — | — | — | — | — | — | — | — | |
| LOVE-R1Size=7B2026.01 | 60.1 | — | — | — | — | — | — | — | — | — | — | |
| LOVE-R1Reasoning Mode=Think-Only2026.01 | 60.1 | — | — | — | — | — | — | — | — | — | — | |
| MemoryCard (Qwen3-VL)LLM Size=8B, #Frames=4+ 8+ 322026.06 | 60.1 | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5Size=7B, #Tokens=2562025.01 | 60 | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-8BFrames=-2026.03 | 60 | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2.5-8BFrames=64, Inference Time=12.4s2025.06 | 60 | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2.5-8BModel Type=Open-Source 7B-8B Model2025.06 | 60 | — | — | — | — | — | — | — | — | — | — | |
| VideoLLaMA3-7BFrames=-2026.03 | 59.8 | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-QAnswerer model=GPT-4o, Frame budget (K)=82026.05 | 59.8 | — | — | — | — | — | — | — | — | — | — | |
| BOLTSource=Paper/Leaderboard2026.03 | 59.6 | — | — | — | — | — | — | — | — | — | — | |
| WFS (CVPR 2026)Answerer model=GPT-4o, Frame budget (K)=82026.05 | 59.6 | — | — | — | — | — | — | — | — | — | — | |
| FixedScaleBackbone=Qwen3-VL-8B, Retention Ratio R=12.3%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 59.5 | — | — | — | — | — | — | — | — | — | — | |
| BIMBA-LLaVALLM=Qwen2-7B, Frames=1282025.03 | 59.46 | — | — | — | — | — | — | — | — | — | — | |
| Video-o3 (RL)Size=7B2026.01 | 59.3 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B-InstructFrames=642026.03 | 59.3 | — | — | — | — | — | — | — | — | — | — | |
| POINTS-LongNum Frame=248+8, Token/Frame=8, Total Num of Token=32002026.04 | 59.3 | — | — | — | — | — | — | — | — | — | — | |
| POINTS-LongNum Frame=504+8, Token/Frame=8, Total Num of Token=52482026.04 | 59.2 | — | — | — | — | — | — | — | — | — | — | |
| GPT4-V2025.01 | 59.1 | — | — | — | — | — | — | — | — | — | — | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B, Retention Ratio R=100%, Reasoning (CoT)=true, Frames=128 Frames2026.03 | 59.1 | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen3-VL-8B, Retention Ratio R=10.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 59.1 | — | — | — | — | — | — | — | — | — | — | |
| POINTS-LongNum Frame=248+8, Token/Frame=16, Total Num of Token=52482026.04 | 59.1 | — | — | — | — | — | — | — | — | — | — | |
| Random DropBackbone=Qwen2.5-VL-7B, Retention Ratio R=10.0%, Reasoning (CoT)=false, Frames=128 Frames2026.03 | 59 | — | — | — | — | — | — | — | — | — | — | |
| FlashVidBackbone=Qwen3-VL-8B, Retention Ratio R=30.0%, Reasoning (CoT)=false, Frames=32 Frames2026.03 | 59 | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Retention Ratio R=100%, Reasoning (CoT)=false, Frames=32 Frames2026.03 | 58.9 | — | — | — | — | — | — | — | — | — | — | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B, Retention Ratio R=100%, Reasoning (CoT)=true, Frames=32 Frames2026.03 | 58.9 | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8BFrames=-2026.03 | 58.8 | — | — | — | — | — | — | — | — | — | — |