Mathematical Reasoning on MATH-500 (Acc, P@N, Tok, CR)
93AccuracyCOT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| COTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 93 | 96.2 | 4,132 | 100 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92.4 | 96 | 3,617 | 87.5 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92 | 96.4 | 1,857 | 44.9 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.6 | 95.6 | 2,694 | 65.2 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.4 | 95.3 | 1,708 | 41.3 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 91.4 | 95 | 1,178 | 28.5 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 91.3 | 95.6 | 3,879 | 93.8 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.3 | 95.2 | 1,984 | 48 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 90.9 | 96.1 | 2,014 | 48.7 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 90.3 | 95.8 | 2,508 | 60.7 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 86 | 93.4 | 5,420 | 100 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 85.7 | 92.5 | 1,354 | 25 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 85.3 | 91.6 | 1,922 | 35.4 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 85.3 | 93.6 | 2,466 | 45.5 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 85.3 | 91.8 | 2,714 | 50 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 84.2 | 92.4 | 1,546 | 28.5 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 83.9 | 92.6 | 3,131 | 57.7 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 83.8 | 91.8 | 5,044 | 93 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 83.5 | 92.7 | 3,874 | 71.5 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 83 | 90.6 | 2,383 | 43.9 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 79.6 | 79.6 | 6,584 | 159.3 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 71.2 | 85.2 | 4,914 | 118.9 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 64.2 | 80.6 | 4,475 | 82.5 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 52 | 52 | 13,685 | 252.4 |