Mathematical Reasoning on GSM8K (Acc, P@N, Token Count, CR)
92.6AccuracyOn-Policy SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 92.6 | 96 | 498 | 29.3 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92.5 | 95.3 | 1,701 | 100 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92.2 | 95.7 | 862 | 50.7 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92.1 | 95.9 | 930 | 54.6 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 92 | 96.2 | 1,439 | 84.6 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.9 | 95.8 | 788 | 46.3 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.7 | 94.9 | 1,371 | 80.6 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=SFT-based2026.02 | 91.6 | 95.1 | 1,601 | 94.1 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 91.4 | 96 | 605 | 35.5 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 87.6 | 93.6 | 487 | 28.6 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=RL-based2026.02 | 87.3 | 94.1 | 371 | 21.8 | |
| On-Policy SFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 86.1 | 92.1 | 696 | 27.5 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-7B, Training Paradigm=training-free2026.02 | 86.1 | 86.1 | 4,323 | 254.1 | |
| L1Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 86 | 93.1 | 1,607 | 63.4 | |
| LASERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 86 | 92.2 | 1,178 | 46.5 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 85.2 | 92.8 | 916 | 36.1 | |
| COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 85 | 92 | 2,533 | 100 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 84.8 | 92.4 | 1,717 | 67.7 | |
| ThinkPruneBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 84.7 | 91.8 | 710 | 28 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 83.5 | 92 | 1,091 | 43 | |
| ER-RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 83.1 | 92 | 721 | 28.5 | |
| CRSTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=SFT-based2026.02 | 78.7 | 89.8 | 1,075 | 42.4 | |
| StepEntropyBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=RL-based2026.02 | 77.1 | 87.7 | 507 | 20 | |
| TokenSkipBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training Paradigm=training-free2026.02 | 52.6 | 52.6 | 12,715 | 501.9 |