Math Reasoning on AIME 25 (mean@32, pass@32)
16.5Mean@32GRPO + Entrocraft
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + EntrocraftRL algorithm=GRPO, Entropy-preserving method=Entrocraft, Temperature=0.6, Answers per question=322026.04 | 16.5 | 46.7 | |
| GSPO + EntrocraftRL algorithm=GSPO, Entropy-preserving method=Entrocraft, Temperature=0.6, Answers per question=322026.04 | 14.7 | 40 | |
| GSPO + Entropy LossRL algorithm=GSPO, Entropy-preserving method=Entropy Loss, Temperature=0.6, Answers per question=322026.04 | 11.9 | 33.3 | |
| W-ReinforceEntropy-preserving method=W-Reinforce, Temperature=0.6, Answers per question=322026.04 | 11.3 | 40 | |
| EntroPICEntropy-preserving method=EntroPIC, Temperature=0.6, Answers per question=322026.04 | 10.9 | 43.3 | |
| GRPO + Clip-HigherRL algorithm=GRPO, Entropy-preserving method=Clip-Higher, Temperature=0.6, Answers per question=322026.04 | 10.8 | 40 | |
| GRPO + Clip-CovRL algorithm=GRPO, Entropy-preserving method=Clip-Cov, Temperature=0.6, Answers per question=322026.04 | 10.8 | 33.3 | |
| GSPO + Clip-HigherRL algorithm=GSPO, Entropy-preserving method=Clip-Higher, Temperature=0.6, Answers per question=322026.04 | 10 | 40 | |
| GSPO + Clip-CovRL algorithm=GSPO, Entropy-preserving method=Clip-Cov, Temperature=0.6, Answers per question=322026.04 | 10 | 40 | |
| GRPO + Entropy LossRL algorithm=GRPO, Entropy-preserving method=Entropy Loss, Temperature=0.6, Answers per question=322026.04 | 9.9 | 33.3 | |
| GRPORL algorithm=GRPO, Temperature=0.6, Answers per question=322026.04 | 8.9 | 40 | |
| GSPORL algorithm=GSPO, Temperature=0.6, Answers per question=322026.04 | 8.9 | 33.3 |