Mathematical Reasoning on MATH 500 (Accuracy, Average Tokens, Token Efficiency)
87.4AccuracyOriginal
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 87.4 | 3,053 | 2.86 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 84.2 | 1,146 | 7.35 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 79.2 | 2,636 | 3 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 78.6 | 2,879 | 2.73 | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 78.2 | 3,515 | 2.22 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 76.8 | 2,419 | 3.17 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 76.2 | 1,841 | 4.14 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 75 | 1,813 | 4.14 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 74.2 | 3,257 | 2.28 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 69.8 | 2,254 | 3.1 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 67.4 | 2,629 | 2.56 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 66.8 | 3,841 | 1.74 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 54.4 | 2,015 | 2.7 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 53 | 1,286 | 4.12 |