Long Video Understanding on Video-MME Long
81.9AccuracyAVP
Evaluation Results
| Method | Links | |
|---|---|---|
| AVPBackbone=Gemini-2.5-Pro2025.12 | 81.9 | |
| SiLVR2025.12 | 77.7 | |
| Gemini-2.5-Pro2025.12 | 77.6 | |
| Gemini-1.5-pro#Frames=256, Model Type=Closed-source Models2026.01 | 77.4 | |
| AVPBackbone=Gemini-2.5-Flash2025.12 | 76.7 | |
| LVAgentAuxiliary Subtitles=true2025.12 | 74.3 | |
| GPT-52026.07 | 74.3 | |
| GPT-4o#Frames=384, Model Type=Closed-source Models2026.01 | 72.1 | |
| OmniMemBackbone=video-SALMONN 2+ (8B), fine-tuned=true2026.05 | 70.2 | |
| OmniMemBackbone=video-SALMONN 2+ (8B), fine-tuned=false2026.05 | 69.6 | |
| Gemini-2.5-Flash2025.12 | 69.1 | |
| PyraVidModel Size=32B2026.05 | 69.1 | |
| Gemini-1.5-ProParams=-, Frame=0.5fps2026.02 | 67.4 | |
| Gemini-1.5-ProSize=-2026.04 | 67.4 | |
| DeepVideoDiscovery (DVD)2025.12 | 67.3 | |
| VideoLucy2025.12 | 66.8 | |
| Light-OmniSize=7B2026.07 | 66.1 | |
| WorldMM-8BSize=8B2026.07 | 66 | |
| GPT-4oParams=-, Frame=3842026.02 | 65.3 | |
| GPT-4o2025.12 | 65.3 | |
| GPT-4oSize=-2026.04 | 65.3 | |
| OmniMemBackbone=video-SALMONN 2+ (4B), fine-tuned=true2026.05 | 65.2 | |
| StreamMemBackbone=video-SALMONN 2+ (8B)2026.05 | 65.1 | |
| AdaReTaKe2025.12 | 65 | |
| HERMESBackbone=video-SALMONN 2+ (8B)2026.05 | 65 | |
| Qwen2.5VL-72B#Frames=128, Model Type=Open-source Models2026.01 | 64.6 | |
| UniformBackbone=video-SALMONN 2+ (8B)2026.05 | 64.6 | |
| InfiniPot-VBackbone=video-SALMONN 2+ (8B)2026.05 | 64.5 | |
| OmniMemBackbone=video-SALMONN 2+ (4B), fine-tuned=false2026.05 | 64.4 | |
| Seed1.5VL-pro#Frames=32, Model Type=Closed-source Models2026.01 | 63.3 | |
| Gemini-2.0-FlashVariant=Flash2026.05 | 62.6 | |
| StreamMemBackbone=video-SALMONN 2+ (4B)2026.05 | 61.9 | |
| M3-AgentSize=32B2026.07 | 61.8 | |
| HERMESBackbone=video-SALMONN 2+ (4B)2026.05 | 61.6 | |
| Qwen3-VL-8BSize=8B2026.07 | 61 | |
| InfiniPot-VBackbone=video-SALMONN 2+ (4B)2026.05 | 60.6 | |
| UniformBackbone=video-SALMONN 2+ (4B)2026.05 | 59.9 | |
| LongVU2025.12 | 59.5 | |
| PyraVidModel Size=8B2026.05 | 59.5 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 57.7 | |
| FrameMind2025.12 | 57.5 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 57 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 56.7 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 56.6 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 56.6 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 56.4 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 56 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 56 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 55.9 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 55.9 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 55.9 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 55.7 | |
| Gemini 2.5 Pro2026.07 | 55.7 | |
| VideoChat-Flash-7BSize=7B2026.04 | 55.4 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 55.4 | |
| Video-RAG2026.07 | 55.4 | |
| M3-AgentModel Size=32B, Variant=RL2026.05 | 55.3 | |
| Qwen2.5-Omni-7BSize=7B2026.07 | 55.3 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 55 | |
| Video-XL-7B#Frames=256, Model Type=Open-source Models2026.01 | 54.9 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 54.9 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 54.3 | |
| VideoTree2025.12 | 54.2 | |
| Video-RTS2025.12 | 54.1 | |
| VideoThinker#Frames=64, Model Type=Agentic LLMs, Base Model=Qwen2.5VL-7B2026.01 | 53.7 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v52026.05 | 53.7 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 53.6 | |
| GPT-4VSize=-2026.04 | 53.5 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v12026.05 | 53.3 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v22026.05 | 53.3 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v32026.05 | 53.3 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 53.2 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v42026.05 | 53.2 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 52.8 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 52.8 | |
| InternVL3.5-4BCheckpoint=Base2026.05 | 52.4 | |
| Video-R1-7B#Frames=64, Model Type=Open-source Models2026.01 | 52.2 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 52.2 | |
| LongVILA-7B#Frames=256, Model Type=Open-source Models2026.01 | 52.1 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 52.1 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 52 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 51.9 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 51.9 | |
| OmniMemBackbone=Qwen-2.5-Omni (7B)2026.05 | 51.9 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 51.8 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 51.8 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 51.8 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 51.6 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 51.3 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 51.1 | |
| HERMESBackbone=Qwen-2.5-Omni (7B)2026.05 | 50.5 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 50.4 | |
| InfiniPot-VBackbone=Qwen-2.5-Omni (7B)2026.05 | 50.3 | |
| mPLUG-Owl3Size=7B2026.04 | 50.1 | |
| UniformBackbone=Qwen-2.5-Omni (7B)2026.05 | 50.1 | |
| Qwen2.5VL-7B#Frames=64, Model Type=Open-source Models2026.01 | 50 | |
| VideoBrainParams=8B, Frame=19.12026.02 | 49.8 | |
| StreamMemBackbone=Qwen-2.5-Omni (7B)2026.05 | 49.8 | |
| Video-R1Params=7B, Frame=322026.02 | 48.2 | |
| VideoAgentModel Type=Agentic LLMs, Base Model=GPT-4, citation=[6]2026.01 | 48.1 |