Mathematical Reasoning on AIME25 (Acc, P@N, Tok, CR)
40AccuracyLASER
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LASERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 40 | 60 | 6,270 | 43.3 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 40 | 60 | 4,039 | 27.9 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 39.3 | 63.3 | 12,585 | 86.9 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 39.3 | 56.6 | 10,895 | 75.3 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 38.6 | 56.6 | 14,478 | 100 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 38 | 56.6 | 14,202 | 98 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 36.6 | 56.6 | 11,786 | 81.4 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 36.6 | 53.3 | 14,785 | 102 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 31.3 | 43.3 | 7,514 | 51.9 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 30.6 | 53.3 | 3,122 | 21.6 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 26 | 40 | 16,348 | 100 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 23.3 | 33.3 | 9,373 | 57.3 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 23.3 | 36.7 | 3,096 | 18.9 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 22.6 | 33.3 | 15,297 | 93.5 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 22.6 | 33.3 | 8,569 | 52.4 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 20.6 | 33.3 | 13,305 | 81.3 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 20 | 30 | 13,147 | 80.4 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 20 | 30 | 2,762 | 16.9 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 18 | 33.3 | 4,213 | 25.8 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 18 | 33.3 | 8,528 | 52.1 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 16.6 | 16.6 | 21,383 | 147.6 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 12.6 | 20 | 15,618 | 107.8 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 6.6 | 23.3 | 14,438 | 88.3 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 3.3 | 3.3 | 28,148 | 172.1 |