Multimodal Mathematical Reasoning on DynaMath
66.4DynaMath ScoreVision-R1-72B*
Evaluation Results
| Method | Links | |
|---|---|---|
| Vision-R1-72B*Params.=72B, additional data during RL training=true2025.03 | 66.4 | |
| Vision-R1-32B*Params.=32B, additional data during RL training=true2025.03 | 65.6 | |
| GPT-4oParams.=-2025.03 | 64.9 | |
| Claude-3.5 SonnetParams.=-2025.03 | 62.5 | |
| Qwen2.5-VL-72BParams.=72B2025.03 | 61.2 | |
| PRCO-7BBackbone=Qwen2.5-VL-7B2026.05 | 59.36 | |
| Qwen2.5-VL-7B + SRPOBackbone=Qwen2.5-VL-7B2026.05 | 58.22 | |
| VPPO-7BBackbone=Qwen2.5-VL-7B2026.05 | 56.88 | |
| PAPO-D-7BBackbone=Qwen2.5-VL-7B2026.05 | 56.54 | |
| Vision-R1-7BParams.=7B2025.03 | 56.3 | |
| Qwen2.5-VL-32BParams.=32B2025.03 | 55.5 | |
| Qwen2.5-VL-7B + DAPOBackbone=Qwen2.5-VL-7B2026.05 | 55.46 | |
| Perception-R1-7BBackbone=Qwen2.5-VL-7B2026.05 | 55.36 | |
| VL-Rethinker-7BBackbone=Qwen2.5-VL-7B2026.05 | 55.14 | |
| Vision-Matters-7BBackbone=Qwen2.5-VL-7B2026.05 | 55.09 | |
| Qwen2.5-VL-7B + GRPOBackbone=Qwen2.5-VL-7B2026.05 | 55.09 | |
| PAPO-G-7BBackbone=Qwen2.5-VL-7B2026.05 | 53.11 | |
| Vision-SR1-7BBackbone=Qwen2.5-VL-7B2026.05 | 52.71 | |
| ThinkLite-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 51.79 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 51.29 | |
| Qwen2.5-VL-7BParams.=7B2025.03 | 50.7 | |
| Qwen2.5-VL-3B + SRPOBackbone=Qwen2.5-VL-3B2026.05 | 48.54 | |
| PRCO-3BBackbone=Qwen2.5-VL-3B2026.05 | 46.31 | |
| Vision-SR1-3BBackbone=Qwen2.5-VL-3B2026.05 | 45.34 | |
| PAPO-D-3BBackbone=Qwen2.5-VL-3B2026.05 | 45.16 | |
| Qwen2.5-VL-3B + GRPOBackbone=Qwen2.5-VL-3B2026.05 | 45.06 | |
| PAPO-G-3BBackbone=Qwen2.5-VL-3B2026.05 | 44.89 | |
| Qwen2.5-VL-3B + DAPOBackbone=Qwen2.5-VL-3B2026.05 | 44.53 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 43.15 | |
| InternVL2.5-78BParams.=78B2025.03 | 41.4 | |
| LLaVA-CoT-11BParams.=11B2025.03 | 34.6 |