Mathematical Reasoning on HMMT NOV. (Pass@128)
43.33Pass@128Qwen2.5-Math + SPS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 43.33 | 5.6 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 40 | 3.15 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 40 | 3.15 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 40 | 3.67 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 40 | 3.1 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 40 | 5.34 | |
| Qwen2.5-MathParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 40 | 3.15 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 40 | 4.82 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 36.67 | 3.98 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 36.67 | 2.99 | |
| Qwen2.5-Math + GSPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 36.67 | 4.92 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 36.67 | 4.97 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 36.67 | 4.04 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 36.67 | 5.34 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 36.67 | 3.93 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 36.67 | 4.56 | |
| Qwen2.5-Math + DAPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 33.33 | 4.04 | |
| Qwen2.5-Math + SPSParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 33.33 | 2.29 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 33.33 | 2.79 | |
| Qwen2.5-Math + SPSParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 33.33 | 3.2 | |
| Qwen2.5-Math + GRPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 33.33 | 5.21 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 30 | 1.07 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 30 | 1.07 | |
| Qwen2.5-Math + GSPOParams.=1.5B, Training Data Regime=OpenR1-10k2026.04 | 30 | 3.8 | |
| Qwen2.5-MathParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 30 | 1.07 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-10k2026.04 | 30 | 4.35 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-3k2026.04 | 26.67 | 3.65 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 3.18 | |
| Qwen2.5-Math + DAPOParams.=7B, Training Data Regime=OpenR1-5k2026.04 | 26.67 | 4.51 | |
| Qwen2.5-Math + GRPOParams.=1.5B, Training Data Regime=OpenR1-3k2026.04 | 23.33 | 3.02 |