Mathematical Reasoning on Average (AIME24, AIME25, AMC23, MATH500, Minerva) (test)
40.7Pass@1GRPO
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GRPOBase Model=Qwen2.5-Math-7B2026.06 | 40.7 | 45.5 | 49.2 | 52.2 | 55.4 | 58.7 | 62.1 | 65.6 | 69.3 | |
| MaxPOBase Model=Qwen2.5-Math-7B2026.06 | 39.9 | 46.5 | 51.7 | 56.2 | 60.1 | 63.8 | 67.5 | 71.1 | 74.3 | |
| Entropy-AdvBase Model=Qwen2.5-Math-7B2026.06 | 38.4 | 43.7 | 48.3 | 52.3 | 56.3 | 60.2 | 64.1 | 67.7 | 70.9 | |
| PKPOBase Model=Qwen2.5-Math-7B2026.06 | 37.2 | 42.6 | 47.4 | 51.4 | 55.1 | 59 | 62.9 | 66.8 | 70.6 | |
| GRPOBase Model=Llama-3.2-3B-Instruct2026.06 | 22.4 | 28 | 33.3 | 38.2 | 42.9 | 47.7 | 52.7 | 57.5 | 62.1 | |
| Entropy-AdvBase Model=Llama-3.2-3B-Instruct2026.06 | 22.1 | 27.7 | 33.2 | 38.5 | 43.6 | 48.5 | 53.3 | 58.2 | 63.1 | |
| MaxPOBase Model=Llama-3.2-3B-Instruct2026.06 | 21.8 | 27.6 | 33.4 | 38.7 | 43.8 | 48.9 | 54 | 59.5 | 65 | |
| PKPOBase Model=Llama-3.2-3B-Instruct2026.06 | 20.1 | 25.5 | 31.3 | 37.1 | 42.5 | 47.5 | 52.7 | 58 | 63.5 |