Video Question Answering on Video-MME Long
82AccuracyGemini 2.5 Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 2.5 ProCategory=MLLMs (Uniform Sampling), Context=1M, # Frames=256, Modality=F, A, # Tokens=100K*2026.01 | 82 | — | |
| HOMERMethod Category=Agent Method, Backbone=Gemini32026.07 | 75.1 | — | |
| EGAgent (Gemini 2.5 Pro)Category=Ours, Context=1M, # Frames=1FPS→50, Modality=F, C, T, # Tokens=134K2026.01 | 74.1 | — | |
| VideoDeepResearch (DeepSeek-r1-0528 + Qwen2.5VL-7B)Category=Agentic Baselines, Context=32K, # Frames=32, Modality=F, T, # Tokens=32K*2026.01 | 72.4 | — | |
| GPT-4.1Category=MLLMs (Uniform Sampling), Context=1M, # Frames=384, Modality=F, # Tokens=60K*2026.01 | 72 | — | |
| DrVideo (DeepSeek V2.5)Category=Agentic Baselines, Context=128K, # Frames=0.2 FPS, Modality=F, T, # Tokens=128K*2026.01 | 71.7 | — | |
| M3-Agent-Gemini3Method Category=Agent Method, Backbone=Gemini32026.07 | 70.7 | — | |
| FullEvo (Guide)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 64.22 | — | |
| Gemini 3 FlashEncoding=Cascade, Variant=+SkillMemCat2026.06 | 62.78 | — | |
| FullEvo (Cat.)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 62.56 | — | |
| M3-AgentMethod Category=Agent Method2026.07 | 61.8 | — | |
| Gemini 3 FlashEncoding=Cascade, Variant=Seed2026.06 | 61.56 | — | |
| Gemini 3 FlashEncoding=Uniform-8, Variant=Plain2026.06 | 61.44 | — | |
| Gemini 3 FlashEncoding=Cascade, Variant=+Evolve2026.06 | 61.33 | — | |
| VideoHV-AgentLLM=GPT-4o2026.03 | 60.6 | — | |
| Gemini 3 FlashEncoding=Cascade, Variant=Plain2026.06 | 60.33 | — | |
| EFlowFramework Type=Native Multi-turn Tool Invocation Video MLLM, Open-source status=Open-source2026.07 | 60.1 | — | |
| GPT-5.2Encoding=Uniform-8, Variant=Plain2026.06 | 58.78 | — | |
| Qwen3-VL*Framework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 58.6 | — | |
| GPT-4O + VSLSSearching Modality=Unimodal, Frame=322025.08 | 57.5 | — | |
| Gemini-GPT-HybridMethod Category=Agent Method2026.07 | 56.5 | — | |
| VCALLM=GPT-4o2026.03 | 56.3 | — | |
| GPT-5.2Encoding=Cascade, Variant=Plain2026.06 | 55.89 | — | |
| FullEvo (Guide)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 55.89 | — | |
| GPT-4O + VSISearching Modality=Multimodal, Frame=82025.08 | 55.8 | — | |
| GPT-4O + VSLSSearching Modality=Unimodal, Frame=82025.08 | 55.6 | — | |
| M3-Agent-Gemini25Method Category=Agent Method, Backbone=Gemini252026.07 | 55.5 | — | |
| GPT-4O + VSISearching Modality=Multimodal, Frame=322025.08 | 55.3 | — | |
| GPT-4OSearching Modality=N/A, Frame=322025.08 | 55.2 | — | |
| GPT-4O + TstarSearching Modality=Unimodal, Frame=322025.08 | 55.2 | — | |
| Gemini-AgentMethod Category=Agent Method2026.07 | 55.1 | — | |
| GPT-4O + TstarSearching Modality=Unimodal, Frame=82025.08 | 55 | — | |
| CogniGPT (Ours)LLM=GPT-42025.09 | 54.7 | 18.3 | |
| GPT-5.2Encoding=Cascade, Variant=+SkillMemCat2026.06 | 54.67 | — | |
| GPT-4OSearching Modality=N/A, Frame=82025.08 | 54.5 | — | |
| VideoTreeLLM=GPT-4o2026.03 | 54.2 | — | |
| VideoTreeFramework Type=Agent-based Framework, Open-source status=Open-source2026.07 | 54.2 | — | |
| GPT-5.2Encoding=Cascade, Variant=Seed2026.06 | 54 | — | |
| VITALFramework Type=Native Multi-turn Tool Invocation Video MLLM, Open-source status=Open-source2026.07 | 54 | — | |
| VideoTreeLLM=GPT-42025.09 | 53.1 | 128 | |
| FullEvo (Cat.)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 52.78 | — | |
| GPT-5.2Encoding=Cascade, Variant=+Evolve2026.06 | 52.22 | — | |
| DrVideoLLM=GPT-42025.09 | 51.7 | 492 | |
| Qwen2.5-VLFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 51 | — | |
| LLaVA-VideoFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 50.6 | — | |
| EGAgent (Qwen2.5-VL-7B)Category=Ours, Context=32K, # Frames=1FPS→50, Modality=F, C, T, # Tokens=172K2026.01 | 47.8 | — | |
| AdaVideoRAG (Qwen2.5-VL-7B)Category=RAG, Context=128K, # Frames=768, Modality=F, C, T, # Tokens=128K*2026.01 | 47.7 | — | |
| CoTLLM=GPT-4o2026.03 | 46.7 | — | |
| LLaVA-OneVisionFramework Type=Single-Turn Video MLLM, Open-source status=Open-source2026.07 | 46.7 | — | |
| VideoAgent*LLM=GPT-42025.09 | 46.4 | 24.6 | |
| LLoViLLM=GPT-3.52025.09 | 45.4 | 492 | |
| Video-RAG (Qwen2.5-VL-7B)Category=RAG, Context=32K, # Frames=32, Modality=F, O, T, # Tokens=10K*2026.01 | 43.3 | — | |
| QWEN2.5-VL-7B-INSTRUCT+VSLSSearching Modality=Unimodal, Frame=82025.08 | 43.2 | — | |
| QWEN2.5-VL-7B-INSTRUCT+VSISearching Modality=Multimodal, Frame=82025.08 | 40.8 | — | |
| QWEN2.5-VL-7B-INSTRUCT+TstarSearching Modality=Unimodal, Frame=82025.08 | 40.3 | — | |
| QWEN2.5-VL-7B-INSTRUCT+VSISearching Modality=Multimodal, Frame=322025.08 | 39.3 | — | |
| LLaVA-Video-7B-Qwen2+VSISearching Modality=Multimodal, Frame=82025.08 | 38.8 | — | |
| LLaVA-Video-7B-Qwen2+VSLSSearching Modality=Unimodal, Frame=82025.08 | 38.5 | — | |
| LLaVA-Video-7B-Qwen2+VSISearching Modality=Multimodal, Frame=322025.08 | 38.2 | — | |
| LLaVA-Video-7B-Qwen2Searching Modality=N/A, Frame=82025.08 | 38 | — | |
| QWEN2.5-VL-7B-INSTRUCTSearching Modality=N/A, Frame=82025.08 | 38 | — | |
| QWEN2.5-VL-7B-INSTRUCT+VSLSSearching Modality=Unimodal, Frame=322025.08 | 37.9 | — | |
| LLaVA-Video-7B-Qwen2+TstarSearching Modality=Unimodal, Frame=82025.08 | 37.5 | — | |
| QWEN2.5-VL-7B-INSTRUCTSearching Modality=N/A, Frame=322025.08 | 37.5 | — | |
| LLaVA-Video-7B-Qwen2+VSLSSearching Modality=Unimodal, Frame=322025.08 | 36.9 | — | |
| LLaVA-Video-7B-Qwen2Searching Modality=N/A, Frame=322025.08 | 35.9 | — | |
| LLaVA-Video-7B-Qwen2+TstarSearching Modality=Unimodal, Frame=322025.08 | 35.8 | — | |
| QWEN2.5-VL-7B-INSTRUCT+TstarSearching Modality=Unimodal, Frame=322025.08 | 34.9 | — | |
| Flash-VStreamMethod Category=Online Video Understanding2026.07 | 25 | — | |
| MovieChatMethod Category=Online Video Understanding2026.07 | 19.4 | — | |
| MA-LMMMethod Category=Online Video Understanding2026.07 | 17.3 | — |