Science Reasoning on ARC-C
97AccuracyQwen3-Next-80B + THINKBRAKE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-Next-80B + THINKBRAKEBackbone=Qwen3-Next-80B, Decoding Strategy=THINKBRAKE2025.10 | 97 | -21.8 | — | |
| Qwen3-Next-80BBackbone=Qwen3-Next-80B, Decoding Strategy=Base2025.10 | 96.8 | — | — | |
| Qwen3-14B + NoWaitBackbone=Qwen3-14B, Decoding Strategy=NoWait2025.10 | 96.2 | -8.1 | — | |
| NoWaitBase Model=Qwen3-14B2025.10 | 96.2 | -8.1 | — | |
| Qwen3-14BBackbone=Qwen3-14B, Decoding Strategy=Base2025.10 | 95.9 | — | — | |
| Qwen3-14BStrategy=Baseline2025.10 | 95.9 | — | — | |
| Qwen3-14B + THINKBRAKEBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE2025.10 | 95.2 | -18.2 | — | |
| THINKBRAKEBase Model=Qwen3-14B2025.10 | 95.2 | -18.2 | — | |
| Qwen3-32B + ThinkLessBackbone=Qwen3-32B, Decoding Strategy=ThinkLess2025.10 | 95.1 | -100 | — | |
| Qwen3-14B + THINKBRAKE-pBackbone=Qwen3-14B, Decoding Strategy=THINKBRAKE-p2025.10 | 94.7 | -17.9 | — | |
| Qwen3-4B-Thinking + Dynasor-CoTBackbone=Qwen3-4B-Thinking, Decoding Strategy=Dynasor-CoT2025.10 | 94.5 | -39.1 | — | |
| Dynasor-CoTBase Model=Qwen3-4B-Thinking2025.10 | 94.5 | -39.1 | — | |
| Qwen3-4B-ThinkingBackbone=Qwen3-4B-Thinking, Decoding Strategy=Base2025.10 | 94.3 | — | — | |
| Qwen3-14B + ThinkLessBackbone=Qwen3-14B, Decoding Strategy=ThinkLess2025.10 | 94.3 | -100 | — | |
| Qwen3-4B-ThinkingStrategy=Baseline2025.10 | 94.3 | — | — | |
| Qwen3-4B-Thinking + ThinkLessBackbone=Qwen3-4B-Thinking, Decoding Strategy=ThinkLess2025.10 | 94.2 | -100 | — | |
| ThinkLessBase Model=Qwen3-4B-Thinking2025.10 | 94.2 | -100 | — | |
| Qwen3-4B-Thinking + THINKBRAKEBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE2025.10 | 94 | -19.9 | — | |
| Qwen3-4BBackbone=Qwen3-4B, Decoding Strategy=Base2025.10 | 94 | — | — | |
| THINKBRAKEBase Model=Qwen3-4B-Thinking2025.10 | 94 | -19.9 | — | |
| Qwen3-4BStrategy=Baseline2025.10 | 94 | — | — | |
| Qwen3-4B + THINKBRAKEBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE2025.10 | 93.9 | -11.5 | — | |
| THINKBRAKEBase Model=Qwen3-4B2025.10 | 93.9 | -11.5 | — | |
| Qwen3-4B-Thinking + THINKBRAKE-pBackbone=Qwen3-4B-Thinking, Decoding Strategy=THINKBRAKE-p2025.10 | 93.7 | -31.7 | — | |
| THINKBRAKE-pBase Model=Qwen3-4B-Thinking2025.10 | 93.7 | -31.7 | — | |
| Qwen3-4B + NoWaitBackbone=Qwen3-4B, Decoding Strategy=NoWait2025.10 | 93.4 | -14.4 | — | |
| Qwen3-4B + THINKBRAKE-pBackbone=Qwen3-4B, Decoding Strategy=THINKBRAKE-p2025.10 | 93.4 | -15 | — | |
| NoWaitBase Model=Qwen3-4B2025.10 | 93.4 | -14.4 | — | |
| Qwen3-4B-Thinking + DEERBackbone=Qwen3-4B-Thinking, Decoding Strategy=DEER2025.10 | 92.8 | -9 | — | |
| DEERBase Model=Qwen3-4B-Thinking2025.10 | 92.8 | -9 | — | |
| Qwen3-4B-Thinking + NoWaitBackbone=Qwen3-4B-Thinking, Decoding Strategy=NoWait2025.10 | 92.7 | 14.6 | — | |
| NoWaitBase Model=Qwen3-4B-Thinking2025.10 | 92.7 | 14.6 | — | |
| Qwen3-32B + THINKBRAKE-pBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE-p2025.10 | 92.2 | -11.7 | — | |
| Qwen3-32BBackbone=Qwen3-32B, Decoding Strategy=Base2025.10 | 92.1 | — | — | |
| Qwen3-32BStrategy=Baseline2025.10 | 92.1 | — | — | |
| Qwen3-32B + THINKBRAKEBackbone=Qwen3-32B, Decoding Strategy=THINKBRAKE2025.10 | 91 | -8 | — | |
| THINKBRAKEBase Model=Qwen3-32B2025.10 | 91 | -8 | — | |
| Qwen3-32B + NoWaitBackbone=Qwen3-32B, Decoding Strategy=NoWait2025.10 | 90.1 | 9 | — | |
| NoWaitBase Model=Qwen3-32B2025.10 | 90.1 | 9 | — | |
| Qwen3-4B + ThinkLessBackbone=Qwen3-4B, Decoding Strategy=ThinkLess2025.10 | 89.3 | -100 | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Token change count2026.06 | 89.16 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Top-1 probability2026.06 | 88.82 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Probability margin2026.06 | 88.74 | — | — | |
| LLaDA + DreamEnsemble Type=Post-generation Ensemble2026.06 | 88.57 | — | — | |
| LLaDA + DreamEnsemble Type=Intermediate-generation Ensemble, Scoring Function=Entropy2026.06 | 88.57 | — | — | |
| DreamEnsemble Type=Single Model2026.06 | 86.69 | — | — | |
| LLaDAEnsemble Type=Single Model2026.06 | 85.15 | — | — | |
| Phi-4-Reasoning + THINKBRAKE-pBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE-p2025.10 | 84.2 | -49.2 | — | |
| Phi-4-Reasoning + ThinkLessBackbone=Phi-4-Reasoning, Decoding Strategy=ThinkLess2025.10 | 82.7 | -100 | — | |
| Phi-4-ReasoningBackbone=Phi-4-Reasoning, Decoding Strategy=Base2025.10 | 80 | — | — | |
| Phi-4-Reasoning + THINKBRAKEBackbone=Phi-4-Reasoning, Decoding Strategy=THINKBRAKE2025.10 | 80 | -25.3 | — | |
| Phi-4-ReasoningStrategy=Baseline2025.10 | 80 | — | — | |
| THINKBRAKEBase Model=Phi-4-Reasoning2025.10 | 80 | -25.3 | — | |
| DeepSeek-R1-7B + Dynasor-CoTBackbone=DeepSeek-R1-7B, Decoding Strategy=Dynasor-CoT2025.10 | 77.8 | -53.6 | — | |
| Phi-4-Reasoning + NoWaitBackbone=Phi-4-Reasoning, Decoding Strategy=NoWait2025.10 | 77.6 | -7 | — | |
| NoWaitBase Model=Phi-4-Reasoning2025.10 | 77.6 | -7 | — | |
| DeepSeek-R1-7B + DEERBackbone=DeepSeek-R1-7B, Decoding Strategy=DEER2025.10 | 73.9 | -10.6 | — | |
| DeepSeek-R1-7B + THINKBRAKEBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE2025.10 | 70.7 | -35.3 | — | |
| THINKBRAKEBase Model=DeepSeek-R1-7B2025.10 | 70.7 | -35.3 | — | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B, Decoding Strategy=Base2025.10 | 67.7 | — | — | |
| DeepSeek-R1-7BStrategy=Baseline2025.10 | 67.7 | — | — | |
| DeepSeek-R1-7B + THINKBRAKE-pBackbone=DeepSeek-R1-7B, Decoding Strategy=THINKBRAKE-p2025.10 | 67.2 | -31 | — | |
| DeepSeek-R1-7B + NoWaitBackbone=DeepSeek-R1-7B, Decoding Strategy=NoWait2025.10 | 64.6 | -12.6 | — | |
| NoWaitBase Model=DeepSeek-R1-7B2025.10 | 64.6 | -12.6 | — | |
| DeepSeek-R1-7B + ThinkLessBackbone=DeepSeek-R1-7B, Decoding Strategy=ThinkLess2025.10 | 50.4 | -100 | — | |
| DAPOBase Model=Qwen3-4B-Instruct-25072026.05 | — | — | 88.5 | |
| DAPOBase Model=Phi-4-mini-instruct2026.05 | — | — | 85 | |
| Dr.GRPOBase Model=Qwen3-4B-Instruct-25072026.05 | — | — | 88.3 | |
| Dr.GRPOBase Model=Phi-4-mini-instruct2026.05 | — | — | 84.8 | |
| GRPOBase Model=Qwen3-4B-Instruct-25072026.05 | — | — | 88 | |
| GRPOBase Model=Phi-4-mini-instruct2026.05 | — | — | 84.6 | |
| SDPOBase Model=Qwen3-4B-Instruct-25072026.05 | — | — | 89 | |
| SDPOBase Model=Phi-4-mini-instruct2026.05 | — | — | 85.4 | |
| Self-OPPOBase Model=Qwen3-4B-Instruct-2507, Optimization Framework=GRPO2026.05 | — | — | 89.5 | |
| Self-OPPOBase Model=Qwen3-4B-Instruct-2507, Optimization Framework=DAPO2026.05 | — | — | 89.6 | |
| Self-OPPOBase Model=Phi-4-mini-instruct, Optimization Framework=GRPO2026.05 | — | — | 86.2 | |
| Self-OPPOBase Model=Phi-4-mini-instruct, Optimization Framework=DAPO2026.05 | — | — | 86.4 | |
| SFTBase Model=Qwen3-4B-Instruct-25072026.05 | — | — | 87.1 | |
| SFTBase Model=Phi-4-mini-instruct2026.05 | — | — | 83.5 | |
| Teacher-OPPOBase Model=Qwen3-4B-Instruct-2507, Optimization Framework=GRPO2026.05 | — | — | 89.8 | |
| Teacher-OPPOBase Model=Qwen3-4B-Instruct-2507, Optimization Framework=DAPO2026.05 | — | — | 90 | |
| Teacher-OPPOBase Model=Phi-4-mini-instruct, Optimization Framework=GRPO2026.05 | — | — | 86.8 | |
| Teacher-OPPOBase Model=Phi-4-mini-instruct, Optimization Framework=DAPO2026.05 | — | — | 87 |