Math Reasoning on AIME 2024 (Acc, ∆Tok)
90AccuracyQwen3-Next-80B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Next-80BBackbone=Qwen3-Next-80B, Decoding Strategy=Base2025.10 | 90 | — | |
| Qwen3-Next-80B + THINKBRAKEBackbone=Qwen3-Next-80B, Decoding Strategy=THINKBRAKE2025.10 | 86.7 | -24.3 | |
| Qwen3-14B + THINKBRAKEBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE2025.10 | 77.9 | -7.4 | |
| Qwen3-4B-ThinkingBackbone=Qwen3-4B-Thinking, Decoding Strategy=Base2025.10 | 77.1 | — | |
| Qwen3-32B + THINKBRAKEBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE2025.10 | 77.1 | -6.2 | |
| Qwen3-32BBackbone=Qwen3-32B, Decoding Strategy=Base2025.10 | 75.8 | — | |
| Phi-4-Reasoning + THINKBRAKEBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE2025.10 | 73.3 | -6.4 | |
| Qwen3-14BBackbone=Qwen3-14B, Decoding Strategy=Base2025.10 | 71.7 | — | |
| Qwen3-14B + NoWaitBackbone=Qwen3-14B, Decoding Strategy=NoWait2025.10 | 70 | -19.8 | |
| Qwen3-4BBackbone=Qwen3-4B, Decoding Strategy=Base2025.10 | 68.8 | — | |
| Phi-4-ReasoningBackbone=Phi-4-Reasoning, Decoding Strategy=Base2025.10 | 67.5 | — | |
| Qwen3-4B-Thinking + THINKBRAKEBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE2025.10 | 67.2 | -33.5 | |
| Qwen3-4B-Thinking + NoWaitBackbone=Qwen3-4B-Thinking, Decoding Strategy=NoWait2025.10 | 66.7 | -30.5 | |
| Qwen3-32B + NoWaitBackbone=Qwen3-32B, Decoding Strategy=NoWait2025.10 | 66.7 | -12 | |
| Qwen3-4B + THINKBRAKEBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE2025.10 | 64.6 | -12.7 | |
| Qwen3-4B-Thinking + DEERBackbone=Qwen3-4B-Thinking, Decoding Strategy=DEER2025.10 | 63.3 | -34.3 | |
| Qwen3-4B-Thinking + Dynasor-CoTBackbone=Qwen3-4B-Thinking, Decoding Strategy=Dynasor-CoT2025.10 | 63.3 | -28.8 | |
| Phi-4-Reasoning + NoWaitBackbone=Phi-4-Reasoning, Decoding Strategy=NoWait2025.10 | 63.3 | -9.4 | |
| Qwen3-4B + NoWaitBackbone=Qwen3-4B, Decoding Strategy=NoWait2025.10 | 56.7 | -16.6 | |
| DeepSeek-R1-7B + DEERBackbone=DeepSeek-R1-7B, Decoding Strategy=DEER2025.10 | 50 | -28.2 | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B, Decoding Strategy=Base2025.10 | 49.5 | — | |
| DeepSeek-R1-7B + THINKBRAKEBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE2025.10 | 45.2 | -25 | |
| DeepSeek-R1-7B + NoWaitBackbone=DeepSeek-R1-7B, Decoding Strategy=NoWait2025.10 | 40 | -32.4 | |
| Phi-4-Reasoning + THINKBRAKE-pBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE-p2025.10 | 39.6 | -63.1 | |
| Qwen3-32B + THINKBRAKE-pBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE-p2025.10 | 39.2 | -61.5 | |
| Qwen3-14B + THINKBRAKE-pBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE-p2025.10 | 38.8 | -68 | |
| Phi-4-Reasoning + ThinkLessBackbone=Phi-4-Reasoning, Decoding Strategy=ThinkLess2025.10 | 36.7 | -100 | |
| Qwen3-4B-Thinking + THINKBRAKE-pBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE-p2025.10 | 35 | -72.6 | |
| DeepSeek-R1-7B + Dynasor-CoTBackbone=DeepSeek-R1-7B, Decoding Strategy=Dynasor-CoT2025.10 | 33.4 | -31.8 | |
| Qwen3-4B + THINKBRAKE-pBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE-p2025.10 | 29.2 | -64.5 | |
| DeepSeek-R1-7B + THINKBRAKE-pBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE-p2025.10 | 25.4 | -71.4 | |
| Qwen3-4B + ThinkLessBackbone=Qwen3-4B, Decoding Strategy=ThinkLess2025.10 | 23.3 | -100 | |
| Qwen3-14B + ThinkLessBackbone=Qwen3-14B, Decoding Strategy=ThinkLess2025.10 | 23.3 | -100 | |
| Qwen3-32B + ThinkLessBackbone=Qwen3-32B, Decoding Strategy=ThinkLess2025.10 | 23.3 | -100 | |
| DeepSeek-R1-7B + ThinkLessBackbone=DeepSeek-R1-7B, Decoding Strategy=ThinkLess2025.10 | 16.7 | -100 | |
| Qwen3-4B-Thinking + ThinkLessBackbone=Qwen3-4B-Thinking, Decoding Strategy=ThinkLess2025.10 | 3.3 | -100 |