Mathematical Reasoning on AMC 2023 (Accuracy, Token Usage, Compression)
96.9AccuracyWHISPER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| WHISPERBase Model=Qwen3-14B2025.10 | 96.9 | 4,019 | 57.9 | |
| BeConciseBase Model=Qwen3-14B2025.10 | 96.6 | 5,992 | 86.3 | |
| ChainofDraftBase Model=Qwen3-14B2025.10 | 95.9 | 5,782 | 83.2 | |
| OriginalBase Model=Qwen3-14B2025.10 | 95 | 6,947 | 100 | |
| DEER*Base Model=Qwen3-14B2025.10 | 94.4 | 5,440 | 78.3 | |
| GEPABase Model=Qwen3-14B2025.10 | 94.1 | 4,890 | 70.4 | |
| GEPABase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 93.8 | 4,102 | 75.2 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 93.1 | 5,454 | 100 | |
| WHISPERBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 93.1 | 4,359 | 79.9 | |
| BeConciseBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 90.6 | 5,326 | 97.7 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 90.4 | 4,315 | 79.1 | |
| DEER*Base Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 90.3 | 4,479 | 82.1 | |
| OriginalBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 89.4 | 6,060 | 100 | |
| WHISPERBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 89.4 | 4,722 | 77.9 | |
| GEPABase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 88.4 | 5,110 | 84.3 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 88.1 | 5,338 | 88.1 | |
| BeConciseBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 87.8 | 5,660 | 93.4 | |
| DEER*Base Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 86.9 | 4,915 | 81.1 | |
| NoThinkingBase Model=Qwen3-14B2025.10 | 71.2 | 1,539 | 22.2 | |
| NoThinkingBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 58.1 | 1,495 | 24.7 | |
| NoThinkingBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 57.8 | 1,058 | 19.4 |