Math Reasoning on MATH 500 (Pass@1, #Tokens)
95.2Pass@1ReBalance
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReBalanceBackbone=QwQ-32B2026.03 | 95.2 | 3,662 | |
| BaselineBackbone=QwQ-32B2026.03 | 94.8 | 4,535 | |
| NoThinkingBackbone=QwQ-32B2026.03 | 94.8 | 3,912 | |
| DEERBackbone=QwQ-32B2026.03 | 94.4 | 3,179 | |
| Dynasor-CoTBackbone=QwQ-32B2026.03 | 94.2 | 4,176 | |
| ReBalanceBackbone=Qwen3-14B2026.03 | 94 | 3,641 | |
| BaselineBackbone=Qwen3-14B2026.03 | 93.8 | 4,470 | |
| CoDBackbone=Qwen3-14B2026.03 | 93.8 | 2,950 | |
| NoThinkingBackbone=Qwen3-14B2026.03 | 93.8 | 2,657 | |
| Dynasor-CoTBackbone=Qwen3-14B2026.03 | 93.8 | 4,063 | |
| CoDBackbone=QwQ-32B2026.03 | 93.8 | 3,516 | |
| NoWaitBackbone=QwQ-32B2026.03 | 93.8 | 2,879 | |
| TrimRBackbone=QwQ-32B2026.03 | 93.8 | 3,830 | |
| SEALBackbone=Qwen3-14B2026.03 | 93.4 | 3,727 | |
| FlashThinkBackbone=QwQ-32B2026.03 | 93.2 | 3,144 | |
| DEERBackbone=Qwen3-14B2026.03 | 93 | 2,825 | |
| NoWaitBackbone=Qwen3-14B2026.03 | 92.8 | 3,219 | |
| ReBalanceBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 92.6 | 2,903 | |
| SEALBackbone=QwQ-32B2026.03 | 92.6 | 3,536 | |
| SEALBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 90.6 | 2,843 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 90 | 3,127 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 89.8 | 3,699 | |
| Manifold SteeringBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 88.4 | 2,239 | |
| Dynasor-CoTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 88.2 | 2,723 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 87.8 | 2,367 | |
| NoWaitBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 86.8 | 2,479 | |
| ReBalanceBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 83 | 3,474 | |
| NeuReasonerModel Size=Qwen3-32B, Condition=our cognitive scaffold, thinking off2026.06 | 82.2 | — | |
| NoThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.03 | 80.6 | 834 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 80.2 | 3,512 | |
| Thinking onRLModel Size=Qwen3-8B, Condition=native RL-trained reasoning mode2026.06 | 80.1 | — | |
| Thinking onRLModel Size=Qwen3-32B, Condition=native RL-trained reasoning mode2026.06 | 79.7 | — | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 79.6 | 4,516 | |
| SEALBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 78.6 | 3,259 | |
| Manifold SteeringBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 78.6 | 3,458 | |
| NoWaitBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 78 | 2,645 | |
| Dynasor-CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 77.2 | 3,694 | |
| NoThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 75 | 1,582 | |
| Thinking offModel Size=Qwen3-32B, Condition=vanilla chain-of-thought, no scaffold2026.06 | 73.7 | — | |
| Thinking offModel Size=Qwen3-8B, Condition=vanilla chain-of-thought, no scaffold2026.06 | 72.3 | — | |
| NeuReasonerModel Size=Qwen3-8B, Condition=our cognitive scaffold, thinking off2026.06 | 68.4 | — | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 67 | 2,251 |