Video Reasoning on VideoMathQA
55.76AccuracyCoPD
Evaluation Results
| Method | Links | |
|---|---|---|
| CoPDTraining Strategy=CoPD2026.04 | 55.76 | |
| Mixed RLVRTraining Strategy=Mixed RLVR2026.04 | 55.71 | |
| MOPDTraining Strategy=MOPD2026.04 | 53.43 | |
| Image-ExpertTraining Strategy=Image-Expert2026.04 | 53.1 | |
| Video-ExpertTraining Strategy=Video-Expert2026.04 | 50.95 | |
| BaseTraining Strategy=Base2026.04 | 49.33 | |
| Text-ExpertTraining Strategy=Text-Expert2026.04 | 47.19 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v22026.05 | 32.62 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v42026.05 | 32.62 | |
| ProcessThinker (process-only)Backbone=QWEN3-VL-8B, Training strategy=GRPO, Reward type=process-only2026.04 | 31.67 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v12026.05 | 30.48 | |
| MiMo-SFT-7BBackbone=MiMo-SFT-7B, Checkpoint=Base2026.05 | 29.76 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v32026.05 | 29.52 | |
| Video-ZeroBackbone=MiMo-SFT-7B, Checkpoint=v52026.05 | 27.86 | |
| ProcessThinker (outcome-only)Backbone=QWEN3-VL-8B, Training strategy=GRPO, Reward type=outcome-only2026.04 | 27.86 | |
| ProcessThinker (outcome + process)Backbone=QWEN3-VL-8B, Training strategy=GRPO, Reward type=outcome + process2026.04 | 27.86 | |
| VIDEO-R1-7BBackbone=QWEN2.5-VL2026.04 | 26.67 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 26.19 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-8B-Instruct2026.05 | 26.19 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 25.95 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 25.48 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-8B-Instruct2026.05 | 25.48 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 25.24 | |
| QWEN3-VL-8B-INSTRUCTBackbone=QWEN3-VL-8B2026.04 | 25.2 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 24.76 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 24.52 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=12026.05 | 24.05 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 23.81 | |
| Base ModelBackbone=Qwen3-VL-8B-Instruct2026.05 | 23.81 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v52026.05 | 23.81 | |
| PROCESSTHINKER-SFTBackbone=QWEN3-VL-8B, Training strategy=SFT2026.04 | 23.57 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 23.33 | |
| Video-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 23.33 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v42026.05 | 23.33 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v32026.05 | 23.1 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 22.86 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 22.62 | |
| Video-Zero (Peak)Backbone=Qwen3-VL-4B-Instruct2026.05 | 22.62 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=52026.05 | 22.38 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=32026.05 | 22.38 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 22.14 | |
| V-ZeroBackbone=Qwen3-VL-8B-Instruct2026.05 | 22.14 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v22026.05 | 21.9 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 21.67 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=22026.05 | 21.67 | |
| Video-Zero (Iter 4)Backbone=Qwen3-VL-4B-Instruct2026.05 | 21.67 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct, Iteration=42026.05 | 21.43 | |
| VisPlayBackbone=Qwen3-VL-8B-Instruct2026.05 | 21.43 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 21.19 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 20.95 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct2026.05 | 20.95 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 20.71 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 20.71 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 20.48 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 20.48 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 20.48 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 19.76 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=52026.05 | 19.52 | |
| V-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=32026.05 | 19.52 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 19.05 | |
| Video-ZeroBackbone=Qwen3-VL-4B-Instruct, Iteration=22026.05 | 19.05 | |
| Base ModelBackbone=Qwen3-VL-4B-Instruct2026.05 | 19.05 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=12026.05 | 18.81 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct, Iteration=42026.05 | 18.33 | |
| VisPlayBackbone=Qwen3-VL-4B-Instruct2026.05 | 18.33 | |
| Video-ZeroBackbone=InternVL3.5-4B, Checkpoint=v12026.05 | 17.86 | |
| InternVL3.5-4BCheckpoint=Base2026.05 | 12.62 |