Mathematical Reasoning on OlympiadBench (Avg@5 accuracy)
58.93Avg@5 AccuracyAsymGRPO w/ Clip-higher
Evaluation Results
| Method | Links | |
|---|---|---|
| AsymGRPO w/ Clip-higherBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 58.93 | |
| AsymGRPOBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 58.48 | |
| GRPO w/ Clip-higherBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 58.18 | |
| GRPOBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 57.74 | |
| Pos-Only Modulation (§ 3.1)Base Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 57.34 | |
| AsymGRPO (βpos = βneg)Base Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 57.34 | |
| GRPO w/ Entro.RegularizationBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 57.24 | |
| Dr.GRPOBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 57.24 | |
| Pass@K TrainingBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 55.06 | |
| REINFORCEBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 54.86 | |
| GRPO w/ Entro.AdvBase Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 54.46 | |
| Neg-Only Modulation (§ 3.1)Base Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 54.46 | |
| EntIncrease (§ 3.2)Base Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 53.03 | |
| EntDecrease (§ 3.2)Base Model=Qwen3-4B, Temperature=0.4, Top-p=1.02026.04 | 50.74 | |
| Qwen3-4BTemperature=0.4, Top-p=1.02026.04 | 47.52 |