Mathematical Reasoning on AIME24, AIME25, AMC, MATH, Minerva, Olympiad (test)
28.33AIME24 AccuracyGRPO
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GRPOBase model=Qwen2.5-Math-7B, Post-training dataset=DAPO (17k), Training steps=500, Group size (G)=4, Temperature=0.62026.04 | 28.33 | 11.88 | 62.61 | 79.6 | 33.09 | 41.78 | 42.88 | |
| GPGBase model=Qwen2.5-Math-7B, Post-training dataset=DAPO (17k), Training steps=500, Group size (G)=4, Temperature=0.62026.04 | 28.23 | 13.96 | 62.05 | 81.4 | 33.09 | 42.22 | 43.49 | |
| KAEBase model=Qwen2.5-Math-7B, Post-training dataset=DAPO (17k), Training steps=500, Group size (G)=4, Temperature=0.62026.04 | 26.98 | 17.81 | 64.53 | 81 | 34.56 | 42.37 | 44.54 | |
| Dr. GRPOBase model=Qwen2.5-Math-7B, Post-training dataset=DAPO (17k), Training steps=500, Group size (G)=4, Temperature=0.62026.04 | 23.75 | 9.9 | 64.08 | 79.2 | 27.57 | 41.04 | 40.92 |