Mathematical Reasoning on HMMT (FEB.)
36.67Pass@128Qwen2.5-Math + SPS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 36.67 | 0.86 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 33.33 | 1.48 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 0.44 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 1.2 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 1.22 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 0.6 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 30 | 1.04 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 30 | 0.47 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 30 | 0.29 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 30 | 1.02 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 26.67 | 1.33 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 26.67 | 0.47 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 0.42 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 0.29 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 0.34 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 1.02 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 26.67 | 1.33 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 26.67 | 1.09 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 23.33 | 0.34 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 23.33 | 0.42 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 23.33 | 0.34 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 23.33 | 0.34 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 23.33 | 0.34 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 23.33 | 0.52 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 20 | 0.23 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 20 | 0.36 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 20 | 0.39 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 13.33 | 0.16 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 13.33 | 0.16 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 13.33 | 0.16 |