Mathematical Reasoning on MATH 500 (Pass@1, Avg tokens)
6,749Average TokensBaseline
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BaselineBackbone=Qwen3-4B-Thinking-25072026.06 | 6,749 | 96.2 | |
| OriginalModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 6,517 | 97.8 | |
| DyConBackbone=Qwen3-4B-Thinking-25072026.06 | 6,092 | 96.2 | |
| DEERBackbone=Qwen3-4B-Thinking-25072026.06 | 5,508 | 94.6 | |
| Budget PromptModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 5,457 | 97.2 | |
| Qwen3-8BType=BASE LLM2025.10 | 5,104 | 92.3 | |
| NoWaitBackbone=Qwen3-4B-Thinking-25072026.06 | 5,062 | 92.6 | |
| O1-PrunerType=SHORT COT2025.10 | 4,968 | 92.43 | |
| BaselineBackbone=Qwen3-14B2026.06 | 4,962 | 95 | |
| CoDBackbone=Qwen3-4B-Thinking-25072026.06 | 4,484 | 95.6 | |
| NothinkingBackbone=Qwen3-4B-Thinking-25072026.06 | 4,362 | 95.2 | |
| BaselineBackbone=QwQ-32B2026.06 | 4,267 | 96 | |
| DeepSeek-R1-DistillModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 4,260 | — | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 4,255 | 95.3 | |
| BeConciseType=SHORT COT2025.10 | 4,232 | 91.55 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 4,101 | 93.4 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 4,098 | 92.6 | |
| Dynasor-CoTBackbone=Qwen3-14B2026.06 | 4,023 | 93.8 | |
| NothinkingBackbone=QwQ-32B2026.06 | 3,989 | 95.6 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 3,978 | 83 | |
| NoWaitType=SHORT COT2025.10 | 3,976 | 92.25 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 3,955 | 92 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 3,891 | 96 | |
| TrimRBackbone=QwQ-32B2026.06 | 3,830 | 93.8 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 3,800 | 94.1 | |
| SEALBackbone=QwQ-32B2026.06 | 3,667 | 93 | |
| CoDBackbone=QwQ-32B2026.06 | 3,662 | 94.8 | |
| DyConBackbone=Qwen3-14B2026.06 | 3,645 | 95 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 3,611 | 94.8 | |
| CoDBackbone=Qwen3-14B2026.06 | 3,535 | 93.8 | |
| MixReasoningType=ADAPTIVE2025.10 | 3,483 | 92.76 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 3,422 | 86.9 | |
| DyConBackbone=QwQ-32B2026.06 | 3,345 | 95.8 | |
| DEERBackbone=QwQ-32B2026.06 | 3,316 | 94.6 | |
| DEERBackbone=Qwen3-14B2026.06 | 3,316 | 94 | |
| NoWaitBackbone=Qwen3-14B2026.06 | 3,305 | 94.6 | |
| DEERType=SHORT COT2025.10 | 3,259 | 91.34 | |
| SFT-S1.1Model Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 3,250 | 95.3 | |
| DyConBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 3,216 | 92 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 3,155 | 83.4 | |
| FlashThinkBackbone=QwQ-32B2026.06 | 3,144 | 93.2 | |
| DeepSeek-R1-DistillModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 3,126 | — | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 2,979 | 91 | |
| SEALBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 2,943 | 91.6 | |
| ThinkpilotBackbone=Qwen3-4B-Thinking-25072026.06 | 2,911 | 88.6 | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,909 | 87.8 | |
| NoWaitBackbone=QwQ-32B2026.06 | 2,902 | 93.6 | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,894 | 81.6 | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,883 | 82.9 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,876 | 88.6 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.12026.05 | 2,869 | 92.2 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,832 | 87.4 | |
| Controlling Thinking SpeedBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 2,818 | 90 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 2,813 | 93.4 | |
| NoWaitBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 2,702 | 89.6 | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,684 | 80.5 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,678 | 89 | |
| VeriThinkerModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=340K2026.05 | 2,674 | 92.8 | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,579 | 87.2 | |
| ThinklessType=HYBRID2025.10 | 2,555 | 81.84 | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,539 | 84.7 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 2,481 | 93.6 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,446 | 82.3 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.42026.05 | 2,432 | 90.6 | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,426 | 86.8 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,398 | 84.1 | |
| CoT-ValveType=SHORT COT2025.10 | 2,375 | 85.45 | |
| Manifold SteeringBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 2,239 | 88.4 | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,239 | 86 | |
| HINT TUNINGModel Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 2,190 | 95.7 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 2,143 | 89.8 | |
| AdaptThinkModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=40K†2026.05 | 2,095 | 92 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 2,015 | 90.2 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 1,976 | 81.8 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 1,944 | 92.5 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,943 | 88.9 | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,937 | 89.3 | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,931 | 88.7 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 1,927 | 95.9 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 1,908 | 93.4 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,908 | 88.9 | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,739 | 91 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,729 | 87.7 | |
| AdaptThinkModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 1,564 | — | |
| AdaCoTModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 1,479 | — | |
| AdaptThinkModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 1,424 | — | |
| AdaCoTModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 1,387 | — | |
| S-GRPOModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 1,377 | — | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 1,359 | 92.5 | |
| LHRMsModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 1,252 | — | |
| NothinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 1,020 | 80 | |
| S-GRPOModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 988 | — | |
| NothinkingBackbone=Qwen3-14B2026.06 | 940 | 87.4 | |
| ThinkpilotBackbone=Qwen3-14B2026.06 | 854 | 86.8 | |
| ThinkpilotBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 715 | 78 | |
| PROGRS-8 (No Centering)rollout_budget=8, centering=none2026.02 | 699.68 | 67.78 | |
| PROGRS-4rollout_budget=42026.02 | 694.7 | 74.14 | |
| PROGRS-8rollout_budget=82026.02 | 683.74 | 74.92 | |
| DAPO-8rollout_budget=82026.02 | 673.86 | 68.4 | |
| DAPO-16rollout_budget=162026.02 | 671.04 | 69.66 |