Mathematical Reasoning on GSM8K (Accuracy, Average Tokens, Token Efficiency)
90.8AccuracyOriginal
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 90.8 | 1,376 | 6.6 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 90.1 | 374 | 24.09 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 84.7 | 1,212 | 6.99 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 84.5 | 1,191 | 7.09 | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 81.6 | 1,669 | 4.89 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 80.6 | 587 | 13.73 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 75.5 | 663 | 11.39 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 73.4 | 1,311 | 5.6 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 72.9 | 1,682 | 4.33 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 71.2 | 279 | 25.52 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 70.7 | 677 | 10.44 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 68.7 | 752 | 9.13 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 67.9 | 978 | 6.95 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 67.9 | 169 | 40.2 |