Math Reasoning on MATH-500 (mean@32, pass@32)
79Mean Score (k=32)GRPO + Entrocraft
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + EntrocraftRL algorithm=GRPO, Entropy-preserving method=Entrocraft, Temperature=0.6, Answers per question=322026.04 | 79 | 93 | |
| GSPO + EntrocraftRL algorithm=GSPO, Entropy-preserving method=Entrocraft, Temperature=0.6, Answers per question=322026.04 | 78.7 | 92.2 | |
| GRPO + Clip-CovRL algorithm=GRPO, Entropy-preserving method=Clip-Cov, Temperature=0.6, Answers per question=322026.04 | 76.8 | 91.8 | |
| GRPO + Entropy LossRL algorithm=GRPO, Entropy-preserving method=Entropy Loss, Temperature=0.6, Answers per question=322026.04 | 76 | 89.8 | |
| GRPO + Clip-HigherRL algorithm=GRPO, Entropy-preserving method=Clip-Higher, Temperature=0.6, Answers per question=322026.04 | 75.8 | 91.4 | |
| GSPORL algorithm=GSPO, Temperature=0.6, Answers per question=322026.04 | 75.6 | 90.2 | |
| GSPO + Clip-HigherRL algorithm=GSPO, Entropy-preserving method=Clip-Higher, Temperature=0.6, Answers per question=322026.04 | 75.5 | 90.4 | |
| GRPORL algorithm=GRPO, Temperature=0.6, Answers per question=322026.04 | 75.3 | 89.4 | |
| GSPO + Clip-CovRL algorithm=GSPO, Entropy-preserving method=Clip-Cov, Temperature=0.6, Answers per question=322026.04 | 75.3 | 91.2 | |
| W-ReinforceEntropy-preserving method=W-Reinforce, Temperature=0.6, Answers per question=322026.04 | 74.9 | 90.8 | |
| GSPO + Entropy LossRL algorithm=GSPO, Entropy-preserving method=Entropy Loss, Temperature=0.6, Answers per question=322026.04 | 74.7 | 90.6 | |
| EntroPICEntropy-preserving method=EntroPIC, Temperature=0.6, Answers per question=322026.04 | 73.7 | 90.2 |