Mathematical Reasoning on AIME24, AIME25, AMC23, MATH500, Minerva (pass@k)
42.3Pass@1GRPO
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GRPOBackbone=Qwen2.5-Math-7B, Reward=response-length reward2026.06 | 42.3 | 48.5 | 53.7 | 58.5 | 62.9 | 66.9 | 70.6 | 74.2 | 77.6 | 80.9 | 84.1 | |
| Ours (Top2@4)Backbone=Qwen2.5-Math-7B, Reward=response-length reward, Config=Top2@42026.06 | 40.6 | 48.1 | 54.4 | 59.8 | 64.3 | 68.3 | 72 | 75.7 | 79.8 | 84.3 | 88.7 | |
| Ours (Top2@4, Bottom2@4)Backbone=Qwen2.5-Math-7B, Reward=response-length reward, Config=Top2@4, Bottom2@42026.06 | 40.3 | 47 | 52.5 | 57.1 | 61.4 | 65.6 | 69.8 | 73.8 | 77.8 | 82.1 | 86.7 | |
| BaseBackbone=Qwen2.5-Math-7B2026.06 | 22.4 | 31.9 | 41.5 | 50.2 | 57.5 | 63.3 | 68.2 | 72.8 | 77.2 | 81.7 | 85.9 | |
| GRPO w/ length penaltyBackbone=Qwen2.5-Math-7B, Reward=response-length reward, Penalty=length penalty2026.06 | 15.7 | 19.1 | 22.2 | 24.9 | 27 | 28.9 | 30.5 | 31.8 | 33.1 | 34.5 | 36.3 |