Mathematical Reasoning on MATH 500 (pass@1, pass@128)
92.51Pass@1 RateQwen3-8B + MEDS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + MEDSBase Model=Qwen3-8B, Training Strategy=MEDS2026.04 | 92.51 | 98.2 | |
| Qwen3-8B + DAPOBase Model=Qwen3-8B, Training Strategy=DAPO2026.04 | 89.18 | 96.6 | |
| Qwen2.5-Math-7B + MEDSBase Model=Qwen2.5-Math-7B, Training Strategy=MEDS2026.04 | 86.33 | 96 | |
| Qwen3-8B + GRPO w/ Entropy AdvBase Model=Qwen3-8B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 85.89 | 96 | |
| Qwen2.5-Math-7B + DAPOBase Model=Qwen2.5-Math-7B, Training Strategy=DAPO2026.04 | 85.61 | 96 | |
| Qwen3-1.7B + MEDSBase Model=Qwen3-1.7B, Training Strategy=MEDS2026.04 | 84.66 | 97.4 | |
| Qwen2.5-Math-7B + GRPO w/ Entropy AdvBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 84.5 | 96.2 | |
| Qwen2.5-Math-7B + GRPOBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO2026.04 | 84.1 | 96.2 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.04 | 83.62 | 95.4 | |
| Qwen3-8B + GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.04 | 82.38 | 95.4 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.04 | 80.86 | 95.2 | |
| Qwen3-1.7B + DAPOBase Model=Qwen3-1.7B, Training Strategy=DAPO2026.04 | 80.25 | 96.6 | |
| Qwen3-1.7B + GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.04 | 79.58 | 95.6 | |
| Qwen3-1.7B + GRPO w/ Entropy AdvBase Model=Qwen3-1.7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 78.72 | 94 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base2026.04 | 30.84 | 96 |