Mathematical Reasoning on AIME'24 (Accuracy, Avg. Tok., SuperBPE, Deltas)
91.3AccuracyQWEN-3-30B-A3B Baseline
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| QWEN-3-30B-A3B BaselineBase Model=QWEN-3-30B-A3B, Training Condition=Baseline2026.04 | 91.3 | 16,305 | — | — | — | |
| Shorthand for Thought (SFT)Base Model=QWEN-3-30B-A3B, Training Condition=SFT2026.04 | 90.3 | 15,246 | 10.7 | -1.2 | -6.5 | |
| Shorthand for Thought (SFT)Base Model=QwQ-32B, Training Condition=SFT2026.04 | 77.7 | 13,160 | 7.6 | 0.2 | -6.5 | |
| QwQ-32B BaselineBase Model=QwQ-32B, Training Condition=Baseline2026.04 | 77.5 | 14,082 | — | — | — | |
| Shorthand for Thought (SFT)Base Model=DeepSeek-R1-Llama-70B-Distill, Training Condition=SFT2026.04 | 70.2 | 7,519 | 12.1 | 5.1 | -17 | |
| DeepSeek-R1-Llama-70B-Distill BaselineBase Model=DeepSeek-R1-Llama-70B-Distill, Training Condition=Baseline2026.04 | 66.7 | 9,059 | — | — | — |