Mathematical Reasoning on AIME25 (Avg@8 Accuracy)
74Accuracy (Avg@8)CERL full
Evaluation Results
| Method | Links | |
|---|---|---|
| CERL fullTraining=SFT+RL2026.05 | 74 | |
| Correctness-only RLTraining=RL2026.05 | 70.8 | |
| HaloTraining=SFT+RL2026.05 | 70.3 | |
| Long-answer SFTTraining=SFT2026.05 | 68.2 | |
| Fixed-ratio erasure + free answerTraining=None2026.05 | 68 | |
| Length-penalty RLTraining=RL2026.05 | 67.3 | |
| Base Qwen3-8BTraining=N/A2026.05 | 67.1 | |
| TokenSkipTraining=SFT2026.05 | 62.9 | |
| ACPOModel=DeepSeek-R1-Distill-Qwen-7B2026.07 | 37.04 | |
| SAPOModel=DeepSeek-R1-Distill-Qwen-7B2026.07 | 34.03 | |
| ACPOModel=Qwen3-8B-Base2026.07 | 30 | |
| GTPOModel=DeepSeek-R1-Distill-Qwen-7B2026.07 | 28.48 | |
| 80/20Model=DeepSeek-R1-Distill-Qwen-7B2026.07 | 27.48 | |
| DAPOModel=DeepSeek-R1-Distill-Qwen-7B2026.07 | 26.67 | |
| SAPOModel=Qwen3-8B-Base2026.07 | 26.43 | |
| ACPOModel=Qwen2.5-Math-7B2026.07 | 25.69 | |
| GTPOModel=Qwen3-8B-Base2026.07 | 25.45 | |
| GRPOModel=DeepSeek-R1-Distill-Qwen-7B2026.07 | 24.83 | |
| 80/20Model=Qwen3-8B-Base2026.07 | 24.5 | |
| DAPOModel=Qwen3-8B-Base2026.07 | 22.92 | |
| GTPOModel=Qwen2.5-Math-7B2026.07 | 22.77 | |
| SAPOModel=Qwen2.5-Math-7B2026.07 | 21.25 | |
| 80/20Model=Qwen2.5-Math-7B2026.07 | 20.5 | |
| DAPOModel=Qwen2.5-Math-7B2026.07 | 19.56 | |
| GRPOModel=Qwen2.5-Math-7B2026.07 | 16.71 | |
| GRPOModel=Qwen3-8B-Base2026.07 | 16.67 |