Mathematical Reasoning on AMC 23 (pass@1, pass@128)
82.62Pass@1Qwen3-8B + MEDS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + MEDSBase Model=Qwen3-8B, Training Strategy=MEDS2026.04 | 82.62 | 97.5 | |
| Qwen3-8B + DAPOBase Model=Qwen3-8B, Training Strategy=DAPO2026.04 | 81.37 | 95 | |
| Qwen2.5-Math-7B + MEDSBase Model=Qwen2.5-Math-7B, Training Strategy=MEDS2026.04 | 74.38 | 97.5 | |
| Qwen2.5-Math-7B + DAPOBase Model=Qwen2.5-Math-7B, Training Strategy=DAPO2026.04 | 72.71 | 97.5 | |
| Qwen2.5-Math-7B + GRPO w/ Entropy AdvBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 70.64 | 97.5 | |
| Qwen2.5-Math-7B + GRPOBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO2026.04 | 70.08 | 97.5 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.04 | 65.72 | 90 | |
| Qwen3-1.7B + MEDSBase Model=Qwen3-1.7B, Training Strategy=MEDS2026.04 | 65.51 | 95 | |
| Qwen3-8B + GRPO w/ Entropy AdvBase Model=Qwen3-8B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 65.49 | 92.5 | |
| Qwen3-8B + GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.04 | 58.79 | 90 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.04 | 58.57 | 87.5 | |
| Qwen3-1.7B + DAPOBase Model=Qwen3-1.7B, Training Strategy=DAPO2026.04 | 57.65 | 95 | |
| Qwen3-1.7B + GRPO w/ Entropy AdvBase Model=Qwen3-1.7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 51.8 | 95 | |
| Qwen3-1.7B + GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.04 | 51.58 | 92.5 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base2026.04 | 19.82 | 92.5 |