Science Reasoning on GPQA-D (Acc, ∆Tok)
76.3AccuracyQwen3-Next-80B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Next-80BBackbone=Qwen3-Next-80B, Decoding Strategy=Base2025.10 | 76.3 | — | |
| Qwen3-Next-80B + THINKBRAKEBackbone=Qwen3-Next-80B, Decoding Strategy=THINKBRAKE2025.10 | 72.7 | -25.6 | |
| Qwen3-4B-Thinking + NoWaitBackbone=Qwen3-4B-Thinking, Decoding Strategy=NoWait2025.10 | 68.2 | -19.6 | |
| Qwen3-4B-Thinking + DEERBackbone=Qwen3-4B-Thinking, Decoding Strategy=DEER2025.10 | 68.2 | -1.3 | |
| Phi-4-Reasoning + THINKBRAKEBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE2025.10 | 67.7 | -1.1 | |
| Qwen3-32B + THINKBRAKEBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE2025.10 | 65.7 | -19.9 | |
| Qwen3-32BBackbone=Qwen3-32B, Decoding Strategy=Base2025.10 | 65.2 | — | |
| Qwen3-4B-ThinkingBackbone=Qwen3-4B-Thinking, Decoding Strategy=Base2025.10 | 64.1 | — | |
| Phi-4-Reasoning + NoWaitBackbone=Phi-4-Reasoning, Decoding Strategy=NoWait2025.10 | 63.1 | -19.1 | |
| Qwen3-4B-Thinking + Dynasor-CoTBackbone=Qwen3-4B-Thinking, Decoding Strategy=Dynasor-CoT2025.10 | 62.6 | -22.6 | |
| Qwen3-4B-Thinking + THINKBRAKEBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE2025.10 | 62.6 | -32.7 | |
| Phi-4-ReasoningBackbone=Phi-4-Reasoning, Decoding Strategy=Base2025.10 | 62.6 | — | |
| Qwen3-14B + NoWaitBackbone=Qwen3-14B, Decoding Strategy=NoWait2025.10 | 62.1 | -20.5 | |
| Qwen3-14B + THINKBRAKEBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE2025.10 | 61.1 | -39.9 | |
| Qwen3-14BBackbone=Qwen3-14B, Decoding Strategy=Base2025.10 | 60.6 | — | |
| Qwen3-32B + NoWaitBackbone=Qwen3-32B, Decoding Strategy=NoWait2025.10 | 60.1 | -12.4 | |
| Phi-4-Reasoning + THINKBRAKE-pBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE-p2025.10 | 59.1 | -62.8 | |
| Qwen3-4B + NoWaitBackbone=Qwen3-4B, Decoding Strategy=NoWait2025.10 | 57.6 | -26.6 | |
| Qwen3-14B + THINKBRAKE-pBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE-p2025.10 | 57.6 | -66.4 | |
| Qwen3-4B + THINKBRAKEBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE2025.10 | 55.6 | -29.7 | |
| Qwen3-32B + ThinkLessBackbone=Qwen3-32B, Decoding Strategy=ThinkLess2025.10 | 54.5 | -100 | |
| Phi-4-Reasoning + ThinkLessBackbone=Phi-4-Reasoning, Decoding Strategy=ThinkLess2025.10 | 54 | -100 | |
| Qwen3-32B + THINKBRAKE-pBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE-p2025.10 | 53.5 | -51 | |
| MCPO-DAPOBackbone=Qwen3-8B2026.05 | 52.44 | — | |
| Qwen3-4BBackbone=Qwen3-4B, Decoding Strategy=Base2025.10 | 51 | — | |
| MCPO-GRPOBackbone=Qwen3-8B2026.05 | 50.57 | — | |
| MGSBackbone=Qwen3-8B2026.05 | 50.25 | — | |
| DAPOBackbone=Qwen3-8B2026.05 | 50.11 | — | |
| Qwen3-4B-Thinking + ThinkLessBackbone=Qwen3-4B-Thinking, Decoding Strategy=ThinkLess2025.10 | 50 | -100 | |
| MT-GRPOBackbone=Qwen3-8B2026.05 | 49.89 | — | |
| CLIPOBackbone=Qwen3-8B2026.05 | 49.83 | — | |
| Qwen3-14B + ThinkLessBackbone=Qwen3-14B, Decoding Strategy=ThinkLess2025.10 | 49.5 | -100 | |
| MCPO-DAPOBackbone=Qwen3-4B2026.05 | 49.13 | — | |
| MCPO-GRPOBackbone=Qwen3-4B2026.05 | 48.81 | — | |
| GRPOBackbone=Qwen3-8B2026.05 | 48.44 | — | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B, Decoding Strategy=Base2025.10 | 48 | — | |
| Qwen3-4B + THINKBRAKE-pBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE-p2025.10 | 47.5 | -54.2 | |
| Qwen3-4B-Thinking + THINKBRAKE-pBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE-p2025.10 | 47 | -67.5 | |
| DAPOBackbone=Qwen3-4B2026.05 | 46.37 | — | |
| Qwen3-4B + ThinkLessBackbone=Qwen3-4B, Decoding Strategy=ThinkLess2025.10 | 46 | -100 | |
| DeepSeek-R1-7B + THINKBRAKEBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE2025.10 | 45.5 | -51.5 | |
| MGSBackbone=Qwen3-4B2026.05 | 45.4 | — | |
| MT-GRPOBackbone=Qwen3-4B2026.05 | 44.06 | — | |
| GRPOBackbone=Qwen3-4B2026.05 | 43.95 | — | |
| DeepSeek-R1-7B + DEERBackbone=DeepSeek-R1-7B, Decoding Strategy=DEER2025.10 | 43.9 | -16.7 | |
| DeepSeek-R1-7B + NoWaitBackbone=DeepSeek-R1-7B, Decoding Strategy=NoWait2025.10 | 43.4 | -35.5 | |
| CLIPOBackbone=Qwen3-4B2026.05 | 42.68 | — | |
| Base ModelBackbone=Qwen3-8B2026.05 | 42.07 | — | |
| DeepSeek-R1-7B + THINKBRAKE-pBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE-p2025.10 | 36.4 | -76.8 | |
| Base ModelBackbone=Qwen3-4B2026.05 | 35.45 | — | |
| DeepSeek-R1-7B + Dynasor-CoTBackbone=DeepSeek-R1-7B, Decoding Strategy=Dynasor-CoT2025.10 | 32.3 | -71.2 | |
| DeepSeek-R1-7B + ThinkLessBackbone=DeepSeek-R1-7B, Decoding Strategy=ThinkLess2025.10 | 30.3 | -100 |