Math and Science Reasoning on Average
89.7AccuracyQwen3-Next-80B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Next-80BBackbone=Qwen3-Next-80B, Decoding Strategy=Base2025.10 | 89.7 | — | |
| Qwen3-Next-80B + THINKBRAKEBackbone=Qwen3-Next-80B, Decoding Strategy=THINKBRAKE2025.10 | 87.6 | -22.3 | |
| Qwen3-4B-ThinkingBackbone=Qwen3-4B-Thinking, Decoding Strategy=Base2025.10 | 83.7 | — | |
| Qwen3-32B + THINKBRAKEBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE2025.10 | 82.6 | -8.2 | |
| Qwen3-32BBackbone=Qwen3-32B, Decoding Strategy=Base2025.10 | 82.4 | — | |
| Qwen3-14B + THINKBRAKEBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE2025.10 | 82 | -15.8 | |
| Qwen3-14BBackbone=Qwen3-14B, Decoding Strategy=Base2025.10 | 81.7 | — | |
| Qwen3-4B-Thinking + NoWaitBackbone=Qwen3-4B-Thinking, Decoding Strategy=NoWait2025.10 | 80.8 | -19 | |
| Qwen3-4B-Thinking + THINKBRAKEBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE2025.10 | 79.7 | -26.5 | |
| Qwen3-14B + NoWaitBackbone=Qwen3-14B, Decoding Strategy=NoWait2025.10 | 79.3 | -19.9 | |
| Qwen3-4B-Thinking + DEERBackbone=Qwen3-4B-Thinking, Decoding Strategy=DEER2025.10 | 79 | -21.8 | |
| Qwen3-32B + NoWaitBackbone=Qwen3-32B, Decoding Strategy=NoWait2025.10 | 77.5 | -11.7 | |
| Qwen3-4B + THINKBRAKEBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE2025.10 | 77.4 | -18.7 | |
| Qwen3-4BBackbone=Qwen3-4B, Decoding Strategy=Base2025.10 | 77.3 | — | |
| Qwen3-4B-Thinking + Dynasor-CoTBackbone=Qwen3-4B-Thinking, Decoding Strategy=Dynasor-CoT2025.10 | 76 | -23 | |
| Qwen3-4B + NoWaitBackbone=Qwen3-4B, Decoding Strategy=NoWait2025.10 | 74.5 | -26.1 | |
| Phi-4-ReasoningBackbone=Phi-4-Reasoning, Decoding Strategy=Base2025.10 | 72.8 | — | |
| Phi-4-Reasoning + THINKBRAKEBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE2025.10 | 72.7 | -13.5 | |
| Phi-4-Reasoning + NoWaitBackbone=Phi-4-Reasoning, Decoding Strategy=NoWait2025.10 | 70 | -10.7 | |
| Qwen3-14B + THINKBRAKE-pBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE-p2025.10 | 66.9 | -51 | |
| Qwen3-32B + THINKBRAKE-pBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE-p2025.10 | 66 | -42.2 | |
| Qwen3-4B-Thinking + THINKBRAKE-pBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE-p2025.10 | 65.2 | -57.2 | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B, Decoding Strategy=Base2025.10 | 64.9 | — | |
| DeepSeek-R1-7B + THINKBRAKEBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE2025.10 | 63.2 | -30 | |
| Qwen3-14B + ThinkLessBackbone=Qwen3-14B, Decoding Strategy=ThinkLess2025.10 | 62.9 | -100 | |
| DeepSeek-R1-7B + DEERBackbone=DeepSeek-R1-7B, Decoding Strategy=DEER2025.10 | 62.9 | -28.3 | |
| Qwen3-4B + THINKBRAKE-pBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE-p2025.10 | 62.8 | -48.8 | |
| Qwen3-32B + ThinkLessBackbone=Qwen3-32B, Decoding Strategy=ThinkLess2025.10 | 62.3 | -100 | |
| Phi-4-Reasoning + THINKBRAKE-pBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE-p2025.10 | 62 | -55.8 | |
| Qwen3-4B + ThinkLessBackbone=Qwen3-4B, Decoding Strategy=ThinkLess2025.10 | 59.7 | -100 | |
| DeepSeek-R1-7B + NoWaitBackbone=DeepSeek-R1-7B, Decoding Strategy=NoWait2025.10 | 59.4 | -29.8 | |
| Phi-4-Reasoning + ThinkLessBackbone=Phi-4-Reasoning, Decoding Strategy=ThinkLess2025.10 | 59.3 | -100 | |
| DeepSeek-R1-7B + THINKBRAKE-pBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE-p2025.10 | 53.5 | -61.4 | |
| DeepSeek-R1-7B + Dynasor-CoTBackbone=DeepSeek-R1-7B, Decoding Strategy=Dynasor-CoT2025.10 | 50.4 | -53 | |
| Qwen3-4B-Thinking + ThinkLessBackbone=Qwen3-4B-Thinking, Decoding Strategy=ThinkLess2025.10 | 50 | -100 | |
| DeepSeek-R1-7B + ThinkLessBackbone=DeepSeek-R1-7B, Decoding Strategy=ThinkLess2025.10 | 47 | -100 |