Mathematical Reasoning on MathVista (Acc@1/Acc@4)
74.2AccuracyQwen2.5-VL-7B + DUPL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-VL-7B + DUPLBase Model=Qwen2.5-VL-7B, RL Algorithm=DUPL2025.10 | 74.2 | — | — | |
| PAPO-7BBase Model=PAPO-7B2025.10 | 73.7 | — | — | |
| Qwen2.5-VL-7B + NoisyRolloutBase Model=Qwen2.5-VL-7B, RL Algorithm=NoisyRollout2025.10 | 72.6 | — | — | |
| MM-Eureka-Qwen-7BBase Model=MM-Eureka-Qwen-7B2025.10 | 71.2 | — | — | |
| Qwen2.5-VL-7B + GRPOBase Model=Qwen2.5-VL-7B, RL Algorithm=GRPO2025.10 | 70.6 | — | — | |
| OpenVLThinker-7BBase Model=OpenVLThinker-7B2025.10 | 70 | — | — | |
| Qwen2.5-VL-3B + DUPLBase Model=Qwen2.5-VL-3B, RL Algorithm=DUPL2025.10 | 69.4 | — | — | |
| VLAA-Thinker-7BBase Model=VLAA-Thinker-7B2025.10 | 68.3 | — | — | |
| Qwen2.5-VL-3B + NoisyRolloutBase Model=Qwen2.5-VL-3B, RL Algorithm=NoisyRollout2025.10 | 67.7 | — | — | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2025.10 | 67.2 | — | — | |
| CFPOGBackbone=Qwen3-VL-2B-Thinking2026.06 | 66.96 | — | — | |
| CoresetBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 66.9 | — | — | |
| RECAPBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 66.7 | — | — | |
| Qwen2.5-VL-3B + GRPOBase Model=Qwen2.5-VL-3B, RL Algorithm=GRPO2025.10 | 66.4 | — | — | |
| UniformBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 65.6 | — | — | |
| Reasoning-onlyBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 65.5 | — | — | |
| R1-Onevision-7BBase Model=R1-Onevision-7B2025.10 | 63.9 | — | — | |
| VLAA-Thinker-7B2025.10 | 63.9 | — | — | |
| LwFBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 63.9 | — | — | |
| PropMixBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 63.4 | — | — | |
| Vision-R1-7B2025.10 | 61.8 | — | — | |
| Qwen2.5-VL-7Bvariant=Base model2025.10 | 61.7 | — | — | |
| OpenVLThinker-7B2025.10 | 59.1 | — | — | |
| Qwen2.5-VL-3BBase Model=Qwen2.5-VL-3B2025.10 | 58.4 | — | — | |
| SFT + VIGILBase Model=Qwen2.5-VL-72B2026.06 | 56.6 | — | — | |
| PAPOGBackbone=Qwen3-VL-2B-Thinking2026.06 | 56.08 | — | — | |
| SFT + DA-DPOBase Model=Qwen2.5-VL-72B2026.06 | 55.4 | — | — | |
| SFT + SimPOBase Model=Qwen2.5-VL-72B2026.06 | 55.2 | — | — | |
| SFT onlyBase Model=Qwen2.5-VL-72B2026.06 | 54.5 | — | — | |
| SFT + DPOBase Model=Qwen2.5-VL-72B2026.06 | 54.1 | — | — | |
| SFT + HA-DPOBase Model=Qwen2.5-VL-72B2026.06 | 53.8 | — | — | |
| GRPOBackbone=Qwen3-VL-2B-Thinking2026.06 | 53.58 | — | — | |
| SFT + VIGILBase Model=Qwen2.5-VL-7B2026.06 | 49.5 | — | — | |
| SFT + SimPOBase Model=Qwen2.5-VL-7B2026.06 | 49.1 | — | — | |
| SFT + DA-DPOBase Model=Qwen2.5-VL-7B2026.06 | 48.8 | — | — | |
| SFT onlyBase Model=Qwen2.5-VL-7B2026.06 | 48.2 | — | — | |
| SFT + DPOBase Model=Qwen2.5-VL-7B2026.06 | 48 | — | — | |
| Gemini-2.5-Pro*Model Category=Closed-Source Models2026.04 | — | 80.9 | 85.2 | |
| GPT-5-Thinking*Model Category=Closed-Source Models2026.04 | — | 81.9 | 86.1 | |
| InternVL2.5-8B*Model Category=Open-Source Models2026.04 | — | 68.2 | 72.8 | |
| MUPO-Thinker-3BModel Category=Our Models2026.04 | — | 64.3 | 72.5 | |
| MUPO-Thinker-7BModel Category=Our Models2026.04 | — | 77.9 | 82.4 | |
| Qwen2.5-VL-7BModel Category=Open-Source Models2026.04 | — | 62.3 | 78.5 | |
| R1-OneVision-7BModel Category=Open-Source Models2026.04 | — | 64.1 | 69.4 | |
| Vision-R1-7BModel Category=Open-Source Models2026.04 | — | 73.5 | 75.6 | |
| VLAA-Thinker-7BModel Category=Open-Source Models2026.04 | — | 68 | 70.8 |