Mathematical Reasoning on AIME 25 (Acc., #Tokens)
61.46Accuracy (AIME 25)Per-Step Scale
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Per-Step ScaleBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 61.46 | 17,138 | |
| MURBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 61.25 | 17,779 | |
| Avg uncertaintyBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 60.83 | 18,608 | |
| MURBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 60.21 | 16,156 | |
| Avg uncertaintyBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 59.79 | 18,131 | |
| Per-Step ScaleBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 59.38 | 17,256 | |
| SMARTBackbone=Qwen3-4B, Reasoning Mode=Thinking Mode2025.07 | 58.96 | 18,104 | |
| SMARTBackbone=Qwen3-8B, Reasoning Mode=Thinking Mode2025.07 | 55.42 | 20,000 | |
| MURBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 31.25 | 16,146 | |
| Avg uncertaintyBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 30.63 | 16,948 | |
| Per-Step ScaleBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 29.17 | 17,880 | |
| SMARTBackbone=Qwen3-1.7B, Reasoning Mode=Thinking Mode2025.07 | 29.17 | 17,316 | |
| Non-Thinking ModeBackbone=Qwen3-8B, Reasoning Mode=Non-Thinking Mode2025.07 | 18.75 | 4,746 | |
| Non-Thinking ModeBackbone=Qwen3-4B, Reasoning Mode=Non-Thinking Mode2025.07 | 15 | 2,577 | |
| Vanilla CoTBackbone=Qwen3-1.7B, Reasoning Mode=Non-Thinking Mode2025.07 | 9.58 | 4,273 |