Mathematical Reasoning on BRUMO (DEF.)
66.67Pass@128Qwen2.5-Math + SPS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 66.67 | 10.05 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 63.33 | 4.71 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 63.33 | 11.67 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 60 | 7.6 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 56.67 | 10.7 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 56.67 | 9.74 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 56.67 | 13.85 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 56.67 | 11.48 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 56.67 | 4.3 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 56.67 | 12.79 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 56.67 | 4.35 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 56.67 | 3.46 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 56.67 | 13.13 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 53.33 | 5 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 53.33 | 12.93 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 50 | 12.16 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 50 | 14.84 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 50 | 10.86 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 50 | 4.61 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 50 | 12.68 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 11.15 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 50 | 9.69 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 50 | 13.41 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 46.67 | 11.51 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 4.09 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 1.48 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 43.33 | 4.09 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 43.33 | 1.48 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 4.09 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 43.33 | 1.48 |