Mathematical Reasoning on GSM8K (test) (Accuracy, Avg Thinking Length)
96Accuracys1-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| s1-32BBackbone=DeepSeek-R1-32B2026.02 | 96 | 1,023.26 | |
| SpecReasonBackbone=DeepSeek-R1-32B2026.02 | 96 | 1,075.98 | |
| PIRBackbone=DeepSeek-R1-32B2026.02 | 95.6 | 197.03 | |
| Specutive ThinkingBackbone=DeepSeek-R1-32B2026.02 | 94.45 | 899.83 | |
| DeepSeek-R1-32BBackbone=DeepSeek-R1-32B2026.02 | 94.2 | 263.04 | |
| prompt to conciseBackbone=DeepSeek-R1-32B2026.02 | 94 | 182.42 | |
| QwQ-32BBackbone=QwQ-32B2026.02 | 93.6 | 290.32 | |
| L1-maxBackbone=DeepSeek-R1-32B2026.02 | 93.4 | 1,198.63 | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B2026.02 | 92.6 | 380.24 | |
| DeepSeek-R1-14BBackbone=DeepSeek-R1-14B2026.02 | 92.6 | 265.91 | |
| DEERBackbone=DeepSeek-R1-32B2026.02 | 91 | 392.25 | |
| SEALBackbone=DeepSeek-R1-32B2026.02 | 89.3 | 279.49 |