Mathematical Reasoning on OlympiadBench (pass@1, pass@128)
61.12Pass@1Qwen3-8B + MEDS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + MEDSBase Model=Qwen3-8B, Training Strategy=MEDS2026.04 | 61.12 | 82.67 | |
| Qwen3-8B + DAPOBase Model=Qwen3-8B, Training Strategy=DAPO2026.04 | 52.77 | 70.81 | |
| Qwen3-8B + GRPO w/ Entropy AdvBase Model=Qwen3-8B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 49.92 | 70.67 | |
| Qwen3-1.7B + MEDSBase Model=Qwen3-1.7B, Training Strategy=MEDS2026.04 | 46.86 | 77.63 | |
| Qwen2.5-Math-7B + MEDSBase Model=Qwen2.5-Math-7B, Training Strategy=MEDS2026.04 | 44.8 | 75.56 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.04 | 44.69 | 61.63 | |
| Qwen2.5-Math-7B + DAPOBase Model=Qwen2.5-Math-7B, Training Strategy=DAPO2026.04 | 44.43 | 75 | |
| Qwen3-8B + GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.04 | 44.22 | 69.78 | |
| Qwen2.5-Math-7B + GRPOBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO2026.04 | 42.57 | 73.63 | |
| Qwen2.5-Math-7B + GRPO w/ Entropy AdvBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 42.57 | 73.63 | |
| Qwen3-1.7B + DAPOBase Model=Qwen3-1.7B, Training Strategy=DAPO2026.04 | 42.2 | 77.04 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.04 | 41.97 | 64.15 | |
| Qwen3-1.7B + GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.04 | 40.19 | 70.37 | |
| Qwen3-1.7B + GRPO w/ Entropy AdvBase Model=Qwen3-1.7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 38.47 | 66.96 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base2026.04 | 9.27 | 70.07 |