Mathematical Reasoning on AMC 23 (Acc, Len)
74.84AccuracyShorterBetter
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ShorterBetterBase Model=DeepSeek-1.5B2026.02 | 74.84 | 6,068 | — | |
| CRTBase Model=DeepSeek-1.5B2026.02 | 74.38 | 6,934 | — | |
| ThinkPruneBase Model=DeepSeek-1.5B, Constraint=1k2026.02 | 72.97 | 7,548 | — | |
| L1Base Model=DeepSeek-1.5B2026.02 | 72.34 | 8,134 | — | |
| ThinkPruneBase Model=DeepSeek-1.5B, Constraint=5002026.02 | 71.88 | 7,715 | — | |
| O1-PrunerBase Model=DeepSeek-1.5B, Ratio=4.02026.02 | 71.88 | 7,848 | — | |
| ACPOBase Model=DeepSeek-1.5B2026.02 | 71.25 | 7,251 | — | |
| O1-PrunerBase Model=DeepSeek-1.5B, Ratio=1.02026.02 | 70.78 | 7,606 | — | |
| DeepSeek-1.5BModel Type=Base Model2026.02 | 69.84 | 8,634 | — | |
| Qwen2.5-7B ERPOModel Scale=7B, Training Method=ERPO2026.03 | 49.53 | — | 98.13 | |
| Qwen3-235B-A22B-Instr.Model Scale=235B2026.03 | 47.81 | — | 55 | |
| Qwen2.5-7B GRPOModel Scale=7B, Training Method=GRPO2026.03 | 47.5 | — | 97.19 | |
| Qwen2.5-3B ERPOModel Scale=3B, Training Method=ERPO2026.03 | 37.5 | — | 96.72 | |
| DeepSeek-R1-671B-0528Model Scale=671B2026.03 | 33.91 | — | 33.91 | |
| Qwen2.5-3B GRPOModel Scale=3B, Training Method=GRPO2026.03 | 32.81 | — | 97.03 | |
| Qwen2.5-1.5B ERPOModel Scale=1.5B, Training Method=ERPO2026.03 | 27.19 | — | 95.31 | |
| Qwen2.5-1.5B GRPOModel Scale=1.5B, Training Method=GRPO2026.03 | 25.31 | — | 95.31 | |
| Qwen2.5-7B BaseModel Scale=7B, Training Method=Base2026.03 | 23.75 | — | 86.09 | |
| Qwen2.5-7B SFTModel Scale=7B, Training Method=SFT2026.03 | 17.03 | — | 96.88 | |
| Qwen2.5-3B BaseModel Scale=3B, Training Method=Base2026.03 | 14.84 | — | 72.66 | |
| Qwen2.5-3B SFTModel Scale=3B, Training Method=SFT2026.03 | 10.63 | — | 99.38 | |
| Qwen2.5-1.5B SFTModel Scale=1.5B, Training Method=SFT2026.03 | 8.13 | — | 98.28 | |
| Qwen2.5-1.5B BaseModel Scale=1.5B, Training Method=Base2026.03 | 0.78 | — | 27.97 |