Mathematical Reasoning on AIME 2024 (Accuracy, P@N, Token Count, CR)
54AccuracyCOT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| COTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 54 | 80 | 13,960 | 100 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 53.3 | 80 | 9,858 | 70.6 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 52.6 | 80 | 11,294 | 80.9 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 52.6 | 80 | 4,594 | 32.9 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 51.3 | 76.6 | 13,372 | 95.7 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 51.3 | 73.3 | 6,104 | 43.7 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 50 | 76.6 | 13,841 | 99.1 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 50 | 80 | 12,791 | 91.6 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 45.9 | 70 | 7,181 | 51.4 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 39.3 | 76.6 | 3,390 | 24.3 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 33.3 | 66.6 | 7,821 | 44.9 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 30.7 | 56.7 | 3,808 | 21.8 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 28.6 | 53.3 | 17,058 | 97.9 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 27.3 | 53.3 | 8,164 | 46.8 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 27.3 | 50 | 11,584 | 66.5 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 26.6 | 46.6 | 12,964 | 74.4 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 25.3 | 50 | 17,418 | 100 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 25.3 | 53.3 | 13,954 | 80.1 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 25.3 | 46.6 | 4,888 | 28.1 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 23.3 | 43.3 | 2,881 | 16.5 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 23.3 | 23.3 | 22,443 | 160.7 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 10 | 26.6 | 15,986 | 114.5 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 8.6 | 30 | 15,437 | 88.6 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 3.3 | 3.3 | 24,889 | 142.8 |