Mathematical Reasoning on Minerva (pass@1, pass@128)
51.58Pass@1Qwen3-8B + MEDS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-8B + MEDSBase Model=Qwen3-8B, Training Strategy=MEDS2026.04 | 51.58 | 68.02 | |
| Qwen3-8B + DAPOBase Model=Qwen3-8B, Training Strategy=DAPO2026.04 | 46.82 | 65.44 | |
| Qwen3-8B + GRPO w/ Entropy AdvBase Model=Qwen3-8B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 45.32 | 65.44 | |
| Qwen3-8B + GRPOBase Model=Qwen3-8B, Training Strategy=GRPO2026.04 | 44.07 | 64.71 | |
| Qwen2.5-Math-7B + DAPOBase Model=Qwen2.5-Math-7B, Training Strategy=DAPO2026.04 | 43.01 | 75.74 | |
| Qwen2.5-Math-7B + MEDSBase Model=Qwen2.5-Math-7B, Training Strategy=MEDS2026.04 | 42.51 | 74.26 | |
| Qwen3-1.7B + MEDSBase Model=Qwen3-1.7B, Training Strategy=MEDS2026.04 | 41.77 | 68.75 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.04 | 40.9 | 61.03 | |
| Qwen2.5-Math-7B + GRPO w/ Entropy AdvBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 40.68 | 70.96 | |
| Qwen3-1.7B + DAPOBase Model=Qwen3-1.7B, Training Strategy=DAPO2026.04 | 39.45 | 69.49 | |
| Qwen2.5-Math-7B + GRPOBase Model=Qwen2.5-Math-7B, Training Strategy=GRPO2026.04 | 39.07 | 73.16 | |
| Qwen3-1.7B + GRPO w/ Entropy AdvBase Model=Qwen3-1.7B, Training Strategy=GRPO w/ Entropy Adv2026.04 | 38.91 | 62.87 | |
| Qwen3-1.7B + GRPOBase Model=Qwen3-1.7B, Training Strategy=GRPO2026.04 | 38.62 | 65.81 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B, Training Strategy=Base2026.04 | 37.82 | 63.6 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base2026.04 | 6.62 | 63.24 |