Mathematical Reasoning on AIME 25 2025 (Pass@128, Avg@128)
56.67Pass@128Qwen2.5-Math + GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 56.67 | 8.75 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 53.33 | 2.94 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 53.33 | 8.41 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 53.33 | 8.17 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 50 | 9.48 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 50 | 8.49 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 50 | 9.85 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 2.76 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 2.53 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 3.1 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 2.61 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 8.75 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 5.26 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 46.67 | 3.1 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 46.67 | 3.41 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 46.67 | 6.2 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 46.67 | 7.66 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 46.67 | 3.1 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 46.67 | 9.48 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 2.11 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 2.76 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 5.5 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 43.33 | 5.5 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 2.05 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 5.5 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 4.85 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 36.67 | 2.86 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 36.66 | 2.84 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 1.62 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 2.69 |