Math Reasoning on AIME 2025 (Acc, ∆Tok)
80AccuracyQwen3-Next-80B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Next-80BBackbone=Qwen3-Next-80B, Decoding Strategy=Base2025.10 | 80 | — | |
| Qwen3-4B-ThinkingBackbone=Qwen3-4B-Thinking, Decoding Strategy=Base2025.10 | 76.2 | — | |
| Qwen3-Next-80B + THINKBRAKEBackbone=Qwen3-Next-80B, Decoding Strategy=THINKBRAKE2025.10 | 73.3 | -16.7 | |
| Qwen3-14BBackbone=Qwen3-14B, Decoding Strategy=Base2025.10 | 69.2 | — | |
| Qwen3-32BBackbone=Qwen3-32B, Decoding Strategy=Base2025.10 | 68.3 | — | |
| Qwen3-32B + THINKBRAKEBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE2025.10 | 68.3 | -4.3 | |
| Qwen3-4B-Thinking + NoWaitBackbone=Qwen3-4B-Thinking, Decoding Strategy=NoWait2025.10 | 66.7 | -35.6 | |
| Qwen3-14B + THINKBRAKEBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE2025.10 | 65.8 | -6 | |
| Phi-4-ReasoningBackbone=Phi-4-Reasoning, Decoding Strategy=Base2025.10 | 63.7 | — | |
| Qwen3-4B-Thinking + THINKBRAKEBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE2025.10 | 62.8 | -33.4 | |
| Qwen3-4B + THINKBRAKEBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE2025.10 | 60.4 | -13.5 | |
| Qwen3-4B-Thinking + DEERBackbone=Qwen3-4B-Thinking, Decoding Strategy=DEER2025.10 | 60 | -37.9 | |
| Qwen3-4BBackbone=Qwen3-4B, Decoding Strategy=Base2025.10 | 59.6 | — | |
| Qwen3-14B + NoWaitBackbone=Qwen3-14B, Decoding Strategy=NoWait2025.10 | 56.7 | -16.6 | |
| Qwen3-32B + NoWaitBackbone=Qwen3-32B, Decoding Strategy=NoWait2025.10 | 56.7 | -10.6 | |
| Qwen3-4B-Thinking + Dynasor-CoTBackbone=Qwen3-4B-Thinking, Decoding Strategy=Dynasor-CoT2025.10 | 53.3 | -28.9 | |
| Phi-4-Reasoning + NoWaitBackbone=Phi-4-Reasoning, Decoding Strategy=NoWait2025.10 | 53.3 | -8.6 | |
| Phi-4-Reasoning + THINKBRAKEBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE2025.10 | 53.3 | -5.2 | |
| Qwen3-4B + NoWaitBackbone=Qwen3-4B, Decoding Strategy=NoWait2025.10 | 50 | -27.1 | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B, Decoding Strategy=Base2025.10 | 37.6 | — | |
| DeepSeek-R1-7B + Dynasor-CoTBackbone=DeepSeek-R1-7B, Decoding Strategy=Dynasor-CoT2025.10 | 33.4 | -26.4 | |
| DeepSeek-R1-7B + DEERBackbone=DeepSeek-R1-7B, Decoding Strategy=DEER2025.10 | 33.3 | -9.8 | |
| DeepSeek-R1-7B + THINKBRAKEBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE2025.10 | 33.2 | -20.3 | |
| Qwen3-4B-Thinking + THINKBRAKE-pBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE-p2025.10 | 30.4 | -76 | |
| Qwen3-14B + ThinkLessBackbone=Qwen3-14B, Decoding Strategy=ThinkLess2025.10 | 30 | -100 | |
| Phi-4-Reasoning + THINKBRAKE-pBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE-p2025.10 | 29.2 | -66.6 | |
| Qwen3-32B + THINKBRAKE-pBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE-p2025.10 | 26.7 | -66.4 | |
| DeepSeek-R1-7B + NoWaitBackbone=DeepSeek-R1-7B, Decoding Strategy=NoWait2025.10 | 26.7 | -36.5 | |
| Qwen3-14B + THINKBRAKE-pBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE-p2025.10 | 26.2 | -72 | |
| Qwen3-4B + THINKBRAKE-pBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE-p2025.10 | 25 | -67.8 | |
| Qwen3-4B + ThinkLessBackbone=Qwen3-4B, Decoding Strategy=ThinkLess2025.10 | 23.3 | -100 | |
| Phi-4-Reasoning + ThinkLessBackbone=Phi-4-Reasoning, Decoding Strategy=ThinkLess2025.10 | 23.3 | -100 | |
| DeepSeek-R1-7B + THINKBRAKE-pBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE-p2025.10 | 22.9 | -73.5 | |
| Qwen3-32B + ThinkLessBackbone=Qwen3-32B, Decoding Strategy=ThinkLess2025.10 | 20 | -100 | |
| DeepSeek-R1-7B + ThinkLessBackbone=DeepSeek-R1-7B, Decoding Strategy=ThinkLess2025.10 | 20 | -100 | |
| Qwen3-4B-Thinking + ThinkLessBackbone=Qwen3-4B-Thinking, Decoding Strategy=ThinkLess2025.10 | 3.3 | -100 |