Mathematical Reasoning on AIME 2025 (Acc, ΔTok)
76.2AccuracyQwen3-4B-Thinking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B-ThinkingStrategy=Baseline2025.10 | 76.2 | — | |
| Qwen3-14BStrategy=Baseline2025.10 | 69.2 | — | |
| Qwen3-32BStrategy=Baseline2025.10 | 68.3 | — | |
| THINKBRAKEBase Model=Qwen3-32B2025.10 | 68.3 | -4.3 | |
| NoWaitBase Model=Qwen3-4B-Thinking2025.10 | 66.7 | -35.6 | |
| THINKBRAKEBase Model=Qwen3-14B2025.10 | 65.8 | -6 | |
| Phi-4-ReasoningStrategy=Baseline2025.10 | 63.7 | — | |
| THINKBRAKEBase Model=Qwen3-4B-Thinking2025.10 | 62.8 | -33.4 | |
| THINKBRAKEBase Model=Qwen3-4B2025.10 | 60.4 | -13.5 | |
| DEERBase Model=Qwen3-4B-Thinking2025.10 | 60 | -37.9 | |
| Qwen3-4BStrategy=Baseline2025.10 | 59.6 | — | |
| NoWaitBase Model=Qwen3-14B2025.10 | 56.7 | -16.6 | |
| NoWaitBase Model=Qwen3-32B2025.10 | 56.7 | -10.6 | |
| Dynasor-CoTBase Model=Qwen3-4B-Thinking2025.10 | 53.3 | -28.9 | |
| NoWaitBase Model=Phi-4-Reasoning2025.10 | 53.3 | -8.6 | |
| THINKBRAKEBase Model=Phi-4-Reasoning2025.10 | 53.3 | -5.2 | |
| NoWaitBase Model=Qwen3-4B2025.10 | 50 | -27.1 | |
| DeepSeek-R1-7BStrategy=Baseline2025.10 | 37.6 | — | |
| THINKBRAKEBase Model=DeepSeek-R1-7B2025.10 | 33.2 | -20.3 | |
| THINKBRAKE-pBase Model=Qwen3-4B-Thinking2025.10 | 30.4 | -76 | |
| NoWaitBase Model=DeepSeek-R1-7B2025.10 | 26.7 | -36.5 | |
| ThinkLessBase Model=Qwen3-4B-Thinking2025.10 | 3.3 | -100 |