Mathematical Reasoning on AIME 2024 (Accuracy, Token Usage, Compression Ratio)
70.8AccuracyChainofDraft
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ChainofDraftBase Model=Qwen3-14B2025.10 | 70.8 | 10,702 | 94.1 | |
| WHISPERBase Model=Qwen3-14B2025.10 | 70 | 8,659 | 76.1 | |
| BeConciseBase Model=Qwen3-14B2025.10 | 67.5 | 10,702 | 94.1 | |
| DEER*Base Model=Qwen3-14B2025.10 | 66.7 | 10,106 | 88.8 | |
| OriginalBase Model=Qwen3-14B2025.10 | 66.2 | 11,375 | 100 | |
| GEPABase Model=Qwen3-14B2025.10 | 66.2 | 9,616 | 84.5 | |
| GEPABase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 65.4 | 9,017 | 90.4 | |
| BeConciseBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 65 | 9,496 | 95.2 | |
| WHISPERBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 65 | 8,513 | 85.3 | |
| DEER*Base Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 62.1 | 9,309 | 93.3 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 61.7 | 9,978 | 100 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 60.8 | 8,916 | 89.4 | |
| GEPABase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 46.8 | 10,279 | 93.3 | |
| WHISPERBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 45.8 | 10,210 | 92.7 | |
| BeConciseBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 45.4 | 11,236 | 102 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 44.6 | 11,193 | 102 | |
| DEER*Base Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 44 | 10,377 | 94.2 | |
| OriginalBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 43.3 | 11,015 | 100 | |
| NoThinkingBase Model=Qwen3-14B2025.10 | 26.7 | 4,259 | 37.4 | |
| NoThinkingBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 23.8 | 2,797 | 28 | |
| NoThinkingBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 15.8 | 4,575 | 41.5 |