Mathematical Reasoning on AIME 2024 (Pass@128 and Avg@128)
73.33Pass@128Qwen2.5-Math + GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 73.33 | 17.37 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 70 | 15.31 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 70 | 16.38 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 70 | 15.6 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 66.67 | 16.25 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 66.67 | 14.37 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 66.67 | 14.69 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 63.33 | 16.12 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 63.33 | 10.39 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 63.33 | 8.91 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 63.33 | 13.1 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 60 | 14.82 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 56.67 | 6.12 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 56.67 | 9.48 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 53.33 | 7.45 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 50 | 6.41 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 50 | 4.77 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 5.94 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 6.07 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 4.3 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 46.67 | 4.3 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 46.67 | 4.3 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 6.64 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 4.56 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 4.48 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 3.8 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 43.33 | 4.35 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 43.33 | 3.8 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 3.8 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 40 | 4.27 |