Video Reasoning on VideoMMMU
68.33AccuracyVideo-Zero
Evaluation Results
| Method | Links | |
|---|---|---|
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v32026.05 | 68.33 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v42026.05 | 67.78 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v12026.05 | 67.56 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v52026.05 | 67.56 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v22026.05 | 67.44 | |
| MiMo-SFT-7BBackbone=MiMo-SFT-7B, Checkpoint=Base2026.05 | 67.33 | |
| LATENT-VC-9BFrames=322026.07 | 65.4 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 65.33 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-8B-Instruct2026.05 | 65.33 | |
| LATENT-VC-9BFrames=642026.07 | 65.3 | |
| LATENT-VC-9BFrames=162026.07 | 65.2 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 64.33 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 64.22 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 64.22 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 64.22 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-8B-Instruct2026.05 | 64.22 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 64.11 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 63.78 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 63.78 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 63.78 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 63.67 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 63.67 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 63.56 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 63.22 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct2026.05 | 63.22 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 63.11 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 62.67 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct2026.05 | 62.67 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 62.22 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 62.22 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 61.56 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-4B-Instruct2026.05 | 61.56 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-4B-Instruct2026.05 | 61.56 | |
| GPT-4o2025.10 | 61.2 | |
| GPT-4oSize=-, Zero-shot=true, Category=Proprietary Models2026.07 | 61.2 | |
| InternVL2.5Size=8B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 60.8 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 60.44 | |
| Qwen3.5-9BSFT+GRPOFrames=322026.07 | 60.3 | |
| Qwen3.5-9BSFT+GRPOFrames=162026.07 | 59.8 | |
| Qwen3.5-9BSFT+GRPOFrames=642026.07 | 59.7 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 59 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 58.89 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 58.33 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct2026.05 | 58.33 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 57.89 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 57.89 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 57.67 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 57.67 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 57.56 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 57.56 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 57.44 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct2026.05 | 57.44 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 57.22 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 57.11 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 57.11 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 56.78 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 56.33 | |
| Gemini-1.5-ProSize=-, Zero-shot=true, Category=Proprietary Models2026.07 | 53.9 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v12026.05 | 53.11 | |
| TimeThinkSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 52.6 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v32026.05 | 52.56 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v52026.05 | 52.56 | |
| VideoCFRFrames=322026.06 | 52.4 | |
| Video-R1-7BFrames=642026.07 | 52.4 | |
| Video-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 52.4 | |
| Video-R1-7BFrames=322026.07 | 52.3 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v42026.05 | 52 | |
| VideoChat-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 52 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v22026.05 | 51.78 | |
| CAREFrames=642026.06 | 51.1 | |
| VideoRFTSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 51.1 | |
| CAREFrames=322026.06 | 51 | |
| VideoCFRFrames=642026.06 | 50.6 | |
| VideoCFRFrames=162026.06 | 50.5 | |
| Qwen-2.5-VLSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 50.3 | |
| Video-COM2026.06 | 50.2 | |
| CAREFrames=162026.06 | 50.2 | |
| Qwen2.5-VL-GRPOSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 50.1 | |
| EvoVidModel=Qwen2.5-VL-7B-Instruct, Training Iteration=Iter 32026.05 | 50 | |
| Video-R1-7BFrames=162026.07 | 49.8 | |
| VideoChat-R1.5Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 49.6 | |
| Qwen2.5-VL-SFTSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 49.4 | |
| EvoVidModel=Qwen3-VL-8B-Instruct, Training Iteration=Iter 32026.05 | 49.1 | |
| EvoVidModel=Qwen3-VL-8B-Instruct, Training Iteration=Iter 12026.05 | 49 | |
| EvoVidModel=Qwen2.5-VL-7B-Instruct, Training Iteration=Iter 12026.05 | 48.9 | |
| Video-R1-7BFrames/Resolution=32/1282025.10 | 48.8 | |
| VideoChat-R1Frames=162026.06 | 48.7 | |
| EvoVidModel=Qwen2.5-VL-7B-Instruct, Training Iteration=Iter 22026.05 | 48.3 | |
| EvoVidModel=Qwen3-VL-8B-Instruct, Training Iteration=Iter 22026.05 | 48.1 | |
| Base ModelModel=Qwen2.5-VL-7B-Instruct, Training Iteration=w/o training2026.05 | 47.8 | |
| EvoVidModel=Qwen3-VL-8B-Instruct, Training Iteration=Frozen Questioner2026.05 | 47.8 | |
| V-Reason-7BFrames/Resolution=16/2562025.10 | 47.8 | |
| Video-R1-7BFrames/Resolution=16/2562025.10 | 47.8 | |
| EvoVidModel=Qwen3-VL-4B-Instruct, Training Iteration=Iter 32026.05 | 47.6 | |
| Qwen2.5-VL-7BFrames/Resolution=16/2562025.10 | 47.6 | |
| V-Reason-7B (Lite)Frames/Resolution=16/2562025.10 | 47.6 | |
| V-Reason-7B (Lite)Frames/Resolution=32/1282025.10 | 47.4 | |
| Qwen2.5-VL-7B2026.06 | 47.4 | |
| Qwen2.5-VL-7B2026.06 | 47.4 | |
| EvoVidModel=Qwen3-VL-4B-Instruct, Training Iteration=Iter 12026.05 | 47.3 |