Long Video Understanding on MLVU
83.8AccuracyQwen3-VL-235B-A22B
Evaluation Results
| Method | Links | |||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-235B-A22BFrames=7682026.01 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed1.5-VLThinking mode=true, Evaluation frame rate=1 FPS2025.05 | 82.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed1.5-VLThinking mode=false, Evaluation frame rate=1 FPS2025.05 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 ProSource=[60]2026.06 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 2.5 ProEvaluation frame rate=1 FPS, self-collected via API=true2025.05 | 81.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-241B-A28B2026.01 | 78.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 78.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2026.06 | 77.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eagle2.5-8BSize=8B2026.04 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full SABackbone=QWen3-VL-8B2026.05 | 75.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 ProSource=[59]2026.06 | 75.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2.5Parameters=78B2026.06 | 75.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 Flash2026.06 | 75.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-XL-2-8BFrames=∼10k2025.10 | 74.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-Flash-7BSize=7B2026.04 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-FlashModel Size=7B, Video Tokens=8K2025.11 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLSize=72B2026.02 | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-72BFrames=7682026.01 | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoSize=72B2026.02 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full SABackbone=Eagle2.5-8B2026.05 | 73.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoRAGParameters=72B2026.06 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoLLaMA3Size=7B2026.02 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoLLaMA3Architecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B + HY-HimmelCtx (k)=16.22026.05 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oryx-1.5Size=32B2024.09 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AriaParameters=28B2026.06 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B baselineCtx (k)=44.72026.05 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8B + HY-HimmelCtx (k)=16.22026.05 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + HY-HimmelCtx (k)=16.22026.05 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8B baselineCtx (k)=44.72026.05 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StateKVBackbone=QWen3-VL-8B, cache budget B=40962026.05 | 71.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OryxSize=34B2024.09 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoSize=7B2026.02 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-7B2026.02 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-9BSize=9B2026.04 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoArchitecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-VideoParameters=7B2026.06 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StateKVBackbone=Eagle2.5-8B, cache budget B=40962026.05 | 70.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Demo-ICL (SFT)Size=7B2026.02 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Demo-ICLSize=7B2026.02 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5Size=8B2026.02 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B baselineCtx (k)=44.72026.05 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5Architecture Type=Modular, Parameter Scale=8B, Training Stage=Instruct2026.05 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| REVISOR (Ours)Model Size=7B, Video Tokens=8K2025.11 | 69.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NEO-ovArchitecture Type=Native, Parameter Scale=8B, Training Stage=Instruct2026.05 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HPPModel=Ours HPP2026.06 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ola-Video (Base)Size=7B2026.02 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o mini2026.06 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8B + MVPFrames=1282026.01 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL*Model Size=7B, Video Tokens=8K, Training=text-based reflection mechanism2025.11 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full SABackbone=QWen3-VL-4B2026.05 | 68.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinVT-Qwen2-VLSize=7B2024.12 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinVT-InternVL2Size=8B2024.12 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=2B, Training Stage=Instruct2026.05 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5VL-3BSize=3B2026.04 | 68.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionParameters=72B2026.06 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinVT-BLIP-3Size=4B2024.12 | 67.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-Thinking + MVPFrames=1282026.01 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StateKVBackbone=QWen3-VL-4B, cache budget B=40962026.05 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinVT-MolmoSize=7B2024.12 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OryxSize=7B2024.12 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OryxSize=7B2024.09 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oryx-1.5Size=7B2024.09 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL⋆Model Size=7B, Video Tokens=8K, Status=reproduction2025.11 | 67.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8B + MVPFrames=642026.01 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-7B + KFCFrames=1fps→82025.10 | 66.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oSize=-2026.02 | 66.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| XCompSize=2B2026.04 | 66.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=72B2024.09 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=72B2026.02 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FrameOracleBackbone=Qwen3-VL-8B, Frames=128→27.82025.10 | 66.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B-Instruct + MVPFrames=1282026.01 | 66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VambaModel Size=10B2025.11 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoChat-Flash-2BSize=2B2026.04 | 65.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7B + Frame-VoyagerFrames=128→82025.10 | 65.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-ThinkingFrames=1282026.01 | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongVUModel Size=7B, Video Tokens=8K2025.11 | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VideoLLaMA3Architecture Type=Modular, Parameter Scale=2B, Training Stage=Instruct2026.05 | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaCodecToken budget=comparable, Backbone=Qwen2-VL-7B2026.06 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinVT-AquilaSize=2B2024.12 | 65.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8BFrames=1282026.01 | 65.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7B + KFCFrames=1fps→82025.10 | 65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 64.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct2026.05 | 64.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-XL-7BFrames=2562025.10 | 64.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NEO-ovArchitecture Type=Native, Parameter Scale=2B, Training Stage=Instruct2026.05 | 64.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=7B2024.12 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=7B2024.09 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionSize=7B2026.02 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7B2026.02 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVisionModel Size=7B, Video Tokens=6K2025.11 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-Zero (Peak)Backbone=Qwen3-VL-8B-Instruct2026.05 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2024.08 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT4-O2024.12 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2024.09 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw-7BFrames=1282026.01 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oSize=-2026.04 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |