Mathematical Reasoning on MathVision mini (test)
52AccuracyPRISM + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PRISM + GRPOBase Model=Qwen3-VL-8B2026.04 | 52 | |
| PRISM + DAPOBase Model=Qwen3-VL-8B2026.04 | 52 | |
| PRISM + GSPOBase Model=Qwen3-VL-8B2026.04 | 51.6 | |
| PRISM + DAPOBase Model=Qwen3-VL-4B2026.04 | 46.7 | |
| PRISM + GSPOBase Model=Qwen3-VL-4B2026.04 | 46.7 | |
| PRISM + GRPOBase Model=Qwen3-VL-4B2026.04 | 45.4 | |
| InstructBase Model=Qwen3-VL-8B2026.04 | 43.7 | |
| + DAPOBase Model=Qwen3-VL-4B2026.04 | 42.7 | |
| + DAPOBase Model=Qwen3-VL-8B2026.04 | 41.5 | |
| + GSPOBase Model=Qwen3-VL-8B2026.04 | 41.1 | |
| + GSPOBase Model=Qwen3-VL-4B2026.04 | 37.5 | |
| + GRPOBase Model=Qwen3-VL-8B2026.04 | 37.1 | |
| PRISMBase Model=Qwen3-VL-8B2026.04 | 37.1 | |
| InstructBase Model=Qwen3-VL-4B2026.04 | 36.5 | |
| + GRPOBase Model=Qwen3-VL-4B2026.04 | 35.5 | |
| Vision-SR1Backbone model=Qwen3-VL-4B2026.05 | 35.5 | |
| IVR-R1Backbone model=Qwen3-VL-4B2026.05 | 35.2 | |
| Qwen2.5-VL-72B-InstructBackbone model=Qwen2.5-VL-72B-Instruct2026.05 | 34.5 | |
| + SFTBase Model=Qwen3-VL-8B2026.04 | 32.6 | |
| Vision-R1Backbone model=Qwen3-VL-4B2026.05 | 32.6 | |
| + SFTBase Model=Qwen3-VL-4B2026.04 | 31.9 | |
| IVR-R1Backbone model=Qwen2.5-VL-7B2026.05 | 31.3 | |
| PRISMBase Model=Qwen3-VL-4B2026.04 | 30.6 | |
| Vision-SR1Backbone model=Qwen2.5-VL-7B2026.05 | 30.6 | |
| Vision-R1Backbone model=Qwen2.5-VL-7B2026.05 | 30.3 | |
| Supervised Fine-tuning (before RL)Backbone model=Qwen3-VL-4B2026.05 | 29.3 | |
| Supervised Fine-tuning (before RL)Backbone model=Qwen2.5-VL-7B2026.05 | 28.9 | |
| Qwen3-VL-32B-InstructBackbone model=Qwen3-VL-32B-Instruct2026.05 | 28 | |
| Qwen2.5-VL-32B-InstructBackbone model=Qwen2.5-VL-32B-Instruct2026.05 | 23.4 | |
| Zero-shot Inference (before RL)Backbone model=Qwen2.5-VL-7B2026.05 | 21.1 | |
| DeepEyesSize=7B2026.05 | 19.4 | |
| AutoToolSize=7B2026.05 | 19.4 | |
| Zero-shot Inference (before RL)Backbone model=Qwen3-VL-4B2026.05 | 18.8 | |
| InternVL3-8BSize=8B2026.05 | 16.8 | |
| Qwen2.5-VL-7BSize=7B2026.05 | 16.1 | |
| LLaVA-OneVisionSize=7B2026.05 | 12.5 | |
| OpenVLThinker-7BBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 0.276 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=22026.01 | 0.27 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=12026.01 | 0.263 | |
| Qwen2.5-VL-7B-Instruct (Base)Backbone=Qwen2.5-VL-7B-Instruct2026.01 | 0.256 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=12026.01 | 0.253 | |
| Supervised GRPOBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 0.25 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=22026.01 | 0.237 | |
| Qwen2.5-VL-3B-Instruct (Base)Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 0.23 |