Mathematical Reasoning on Average (GSM8K, MATH-500, AMC23)
83.9AccuracyCRISP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CRISPModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 83.9 | 1,235 | 6.8 | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 83.6 | 2,971 | 2.81 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 76.6 | 1,779 | 4.31 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 75.4 | 2,215 | 3.4 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 74.9 | 2,665 | 2.81 | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 73.3 | 3,483 | 2.1 | |
| CRISPModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 71.9 | 1,669 | 4.31 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 71.7 | 2,253 | 3.15 | |
| CoDModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 69.8 | 2,673 | 2.61 | |
| TALEModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 68.5 | 2,940 | 2.31 | |
| TruncationModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 63.6 | 2,399 | 2.65 | |
| TokenSkipModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 63.2 | 4,295 | 1.77 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-7B2026.04 | 55.3 | 1,370 | 4.04 | |
| A*-ThoughtModel=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 55 | 1,840 | 2.99 |