Multimodal Math Reasoning on MMK12
80.83AccuracyQwen2.5-VL-7B + PGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + PGPOModel Size=7B, Optimization Strategy=PGPO2026.04 | 80.83 | |
| Qwen2.5-VL-7B + PAPOModel Size=7B, Optimization Strategy=PAPO2026.04 | 80.58 | |
| Qwen2.5-VL-7B + VPPOModel Size=7B, Optimization Strategy=VPPO2026.04 | 80.11 | |
| Qwen2.5-VL-7B + DAPOModel Size=7B, Optimization Strategy=DAPO2026.04 | 78.74 | |
| Qwen2.5-VL-7B + GRPOModel Size=7B, Optimization Strategy=GRPO2026.04 | 76.45 | |
| R1-ShareVL-7BModel Size=7B2026.04 | 70.94 | |
| QvQ-72B-PreviewModel Access=Open-source, Model Scale=72B2026.06 | 70.5 | |
| Qwen2.5-VL-7B-Instruct + VEPOModel Access=Open-source, Model Scale=7B, Learning Strategy=VEPO2026.06 | 69.64 | |
| VPPO-7BModel Access=Open-source, Model Scale=7B, Learning Strategy=Visual-focused RL Fine-tuning2026.06 | 69.02 | |
| VL-Rethinker-7BModel Size=7B2026.04 | 68.3 | |
| MM-Eureka-7BModel Size=7B2026.04 | 67.68 | |
| InternVL2.5-38BModel Access=Open-source, Model Scale=38B2026.06 | 66.8 | |
| NoisyRollout-7BModel Access=Open-source, Model Scale=7B, Learning Strategy=Visual-focused RL Fine-tuning2026.06 | 66.05 | |
| PAPO-DAPO-7BModel Access=Open-source, Model Scale=7B, Learning Strategy=Visual-focused RL Fine-tuning2026.06 | 66.05 | |
| R1-ShareVLModel Access=Open-source, Model Scale=7B, Learning Strategy=Visual-focused RL Fine-tuning2026.06 | 65.68 | |
| Gemini-2.0-FlashModel Access=Closed-source2026.06 | 65.2 | |
| Qwen2.5-VL-7B-Instruct + GRPOModel Access=Open-source, Model Scale=7B, Learning Strategy=GRPO2026.06 | 65.18 | |
| Qwen2.5-VL-7B-Instruct + GRPO (Top 20% high entropy)Model Access=Open-source, Model Scale=7B, Learning Strategy=GRPO, Entropy Selection Strategy=Top 20% high entropy2026.06 | 64.93 | |
| Qwen2.5-VL-3B + PGPOModel Size=3B, Optimization Strategy=PGPO2026.04 | 64.74 | |
| Qwen2.5-VL-3B + VPPOModel Size=3B, Optimization Strategy=VPPO2026.04 | 63.76 | |
| Qwen2.5-VL-3B + PAPOModel Size=3B, Optimization Strategy=PAPO2026.04 | 63.54 | |
| Qwen2.5-VL-7B-Instruct + GRPO (Top 40% high entropy)Model Access=Open-source, Model Scale=7B, Learning Strategy=GRPO, Entropy Selection Strategy=Top 40% high entropy2026.06 | 63.44 | |
| Qwen2.5-VL-3B + DAPOModel Size=3B, Optimization Strategy=DAPO2026.04 | 63.36 | |
| Qwen2.5-VL-3B + GRPOModel Size=3B, Optimization Strategy=GRPO2026.04 | 62.95 | |
| InternVL2.5-78BModel Access=Open-source, Model Scale=78B2026.06 | 61.6 | |
| Qwen2.5-VL-32BModel Access=Open-source, Model Scale=32B2026.06 | 61.5 | |
| Qwen2.5-VL-72BModel Access=Open-source, Model Scale=72B2026.06 | 58 | |
| AVATARbackbone=Qwen2.5-VL-7B2025.08 | 57.8 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o Replay Buffer (on-policy)2025.08 | 57 | |
| Qwen2.5-VL-7B + GRPOtraining=GRPO2025.08 | 56.3 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o TAS (uniform credit)2025.08 | 56.2 | |
| AVATARbackbone=Qwen2.5-VL-7B, ablation=w/o Hinting2025.08 | 55.6 | |
| Claude-3.7-SonnetModel Access=Closed-source2026.06 | 55.3 | |
| Qwen2.5-VL-7B-InstructModel Access=Open-source, Model Scale=7B2026.06 | 53.66 | |
| OpenVLThinker-7B2025.08 | 53.5 | |
| VLAAThinker-VL-7B2025.08 | 51.7 | |
| NoisyRollout-7BModel Size=7B2026.04 | 50 | |
| GPT-4oModel Access=Closed-source2026.06 | 49.9 | |
| Qwen2.5-VL-7Bstatus=Baseline2025.08 | 47.9 | |
| Qwen2.5-VL-7BModel Size=7B2026.04 | 43.04 | |
| Qwen2.5-VL-3BModel Size=3B2026.04 | 37.37 |