Mathematical Reasoning on MATH500 (test)
97.3AccuracyDeepSeek r1
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek r1Model Type=Open Weights, Fine-tuning examples=>800K2025.01 | 97.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecExitBase Model=Qwen3-4B-Thinking-25072026.02 | 96.8 | — | — | — | — | — | — | — | — | 0.3679 | — | 4,777 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ThinkBase Model=Qwen3-4B-Thinking-25072026.02 | 96.6 | — | — | — | — | — | — | — | — | 0.5301 | — | 6,719 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NoThink*Base Model=Qwen3-4B-Thinking-25072026.02 | 96.6 | — | — | — | — | — | — | — | — | 0.4885 | — | 6,395 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EAGLE3Base Model=Qwen3-4B-Thinking-25072026.02 | 96.6 | — | — | — | — | — | — | — | — | 0.3957 | — | 6,670 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ada-R1Method Category=Training-based2026.01 | 96.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,746 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RPAMMethod Category=Data-dependent Merging2026.01 | 96.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,191 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S-GRPOBackbone=Qwen3-14B2026.04 | 96.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,652 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Task ArithmeticMethod Category=Data-free Merging2026.01 | 96.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,720 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L1-4BParameters=4B, Curriculum Stage=L12026.02 | 96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L3-4BParameters=4B, Curriculum Stage=L32026.02 | 96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B-ThinkingMethod Category=Base Model, Thinking Strategy=Long-CoT2026.01 | 96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6,125 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RL + Length PenaltyBackbone=Qwen3-14B2026.04 | 95.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,866 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Average MergingMethod Category=Data-free Merging2026.01 | 95.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,422 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen3-14B2026.04 | 95.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,503 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-RL-4BParameters=4B, Type=Baseline, Training=Reinforcement Learning2026.02 | 95.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIES MergingMethod Category=Data-free Merging2026.01 | 95.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,411 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DTSRBackbone=Qwen3-14B2026.04 | 95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,247 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| o1Model Type=API only, Fine-tuning examples=N.A.2025.01 | 94.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiQ-L2-4BParameters=4B, Curriculum Stage=L22026.02 | 94.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDMethod Category=Prompt-guided2026.01 | 94.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,106 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AIMMethod Category=Data-dependent Merging2026.01 | 94.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,923 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B (SFT Only)Training=NO, Mode=None, Test Setting=Think, Model=Qwen3-8B2026.01 | 94.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 5,557 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B-InstructMethod Category=Base Model, Thinking Strategy=Short-CoT2026.01 | 94.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,670 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BParameters=4B, Type=Baseline2026.02 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OriginalSetting=Think, Backbone=Qwen3-14B2026.01 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,904 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DEERBase Model=Qwen3-4B-Thinking-25072026.02 | 94.4 | — | — | — | — | — | — | — | — | 0.5196 | — | 4,893 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| r1-distillModel Type=Open Weights, Fine-tuning examples=800K2025.01 | 94.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARE-LinearMethod Category=Data-free Merging2026.01 | 94.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,858 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mid-ThinkTraining=RL, Mode=Mid-Think, Test Setting=Think, Model=Qwen3-8B2026.01 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 5,302 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 94.09 | — | — | — | — | — | — | — | — | 120.16 | — | 6.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B (Baseline)Training=NO, Mode=None, Test Setting=Think2026.01 | 94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 5,334 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ACMMethod Category=Data-dependent Merging2026.01 | 94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,208 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B (RL-No-Think)Training=RL, Mode=No-Think, Test Setting=Think2026.01 | 93.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 7,458 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B (Mid-Think)Training=RL, Mode=Mid-Think, Test Setting=Think2026.01 | 93.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 5,456 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B (RL Think)Training=RL, Mode=Think, Test Setting=Think, Model=Qwen3-8B2026.01 | 93.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,568 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B (RL No-Think)Training=RL, Mode=No-Think, Test Setting=Think, Model=Qwen3-8B2026.01 | 93.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6,335 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIRBackbone=DeepSeek-R1-32B2026.02 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,485.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PROMPTCOT-DS-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Reasoning Strategy=long-CoT, Parameters=7B2025.03 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S1-32BNumber of Parameters=32B2025.03 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PROMPTCOT-DS-7BNumber of Parameters=7B2025.03 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Bespoke-32BModel Type=Open Weights and Open Data, Fine-tuning examples=17K2025.01 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| s1-32BModel Type=Open Weights and Open Data, Fine-tuning examples=1K, Budget Forcing=true2025.01 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPIRALFamily=DeepSeek-Distill-Qwen-7B Family, Game=Multi-Game2025.06 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Solver + Verifier (AstraFlow)Backbone=Qwen3-8B, Framework=AstraFlow, Time/iter (s)=77.652026.05 | 92.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=Qwen3-4B-Base, RL Setting=Task reward only2026.02 | 92.89 | — | — | — | — | — | — | — | — | 254.09 | — | 6.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Task + efficiency reward used2026.02 | 92.64 | — | — | — | — | — | — | — | — | 58.67 | — | 3.41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| s1 w/o BFModel Type=Open Weights and Open Data, Fine-tuning examples=1K, Budget Forcing=false2025.01 | 92.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT + RLModel=Qwen3-8B, Tokens=16712026.04 | 92.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B (RL-Think)Training=RL, Mode=Think, Test Setting=Think2026.01 | 92.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,061 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Laser-DEBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 92.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,942 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fixed TokensSetting=5k tokens, Backbone=Qwen3-14B2026.01 | 92.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4,136 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiPOModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 92.2 | — | — | — | — | — | — | — | — | — | — | — | 51.3 | — | — | — | — | — | — | 1,354.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mid-ThinkSetting=training-free, Backbone=Qwen3-14B2026.01 | 92.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,589 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecReasonBackbone=DeepSeek-R1-32B2026.02 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,380.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,918 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Laser-DBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,950 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=Qwen3-4B-Base, RL Setting=Cold start only (No RL)2026.02 | 91.99 | — | — | — | — | — | — | — | — | 85.66 | — | 4.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=Qwen3-4B-Base, RL Setting=Cold start only (No RL)2026.02 | 91.97 | — | — | — | — | — | — | — | — | 139.6 | — | 4.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TALE-EPModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 91.8 | — | — | — | — | — | — | — | — | — | — | — | 38.8 | — | — | — | — | — | — | 2,046.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTFamily=DeepSeek-Distill-Qwen-7B Family, Protocol=Multi2025.06 | 91.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7BReasoning Strategy=long-CoT, Parameters=7B, Reproduced with Paper Prompt=true2025.03 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B (RL No-Think)Training=RL, Mode=No-Think, Test Setting=No-think, Model=Qwen3-8B2026.01 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,268 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPOBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,720 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task reward only2026.02 | 91.56 | — | — | — | — | — | — | — | — | 34.26 | — | 6.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 91.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,568 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fixed TokensSetting=3k tokens, Backbone=Qwen3-14B2026.01 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,315 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Prompt-basedSetting=Prompt, Backbone=Qwen3-14B2026.01 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,131 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JETBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,091 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT + RLModel=Qwen3-4B, Tokens=15232026.04 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fixed TokensSetting=4k tokens, Backbone=Qwen3-14B2026.01 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,793 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-Distill-Qwen-7BFamily=DeepSeek-Distill-Qwen-7B Family2025.06 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Abstract-CoT (Warm-up + RL)Model=Qwen3-8B, Tokens=1442026.04 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Solver + Verifier (verl)Backbone=Qwen3-8B, Framework=verl, Time/iter (s)=212.642026.05 | 90.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BNumber of Parameters=32B2025.03 | 90.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BModel Type=Open Weights, Fine-tuning examples=N.A.2025.01 | 90.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| prompt to conciseBackbone=DeepSeek-R1-32B2026.02 | 90.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,161.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SolverBackbone=Qwen3-8B2026.05 | 90.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-32BNumber of Parameters=32B, Prompting Strategy=reproduced using our prompt2025.03 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DEERBackbone=DeepSeek-R1-32B2026.02 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,280.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Specutive ThinkingBackbone=DeepSeek-R1-32B2026.02 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,943.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| o1-miniModel Type=API only, Fine-tuning examples=N.A.2025.01 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VTC-R1Backbone=Qwen3-VL-8B2026.01 | 90 | — | — | — | — | — | — | — | — | 2.49 | — | 3.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 90 | — | — | — | — | — | — | — | — | — | — | — | 31.8 | — | — | — | — | — | — | 3,185.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 90 | — | — | — | — | — | — | — | — | — | — | — | 47.4 | — | — | — | — | — | — | 1,786.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| s1-32BBackbone=DeepSeek-R1-32B2026.02 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,922.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPOBackbone=DeepSeek-Distill-Qwen-7B2025.09 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,590 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InftyThink+Base Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task + efficiency reward used2026.02 | 89.96 | — | — | — | — | — | — | — | — | 17.71 | — | 3.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT (CoT)Model=Qwen3-8B, Tokens=15222026.04 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Abstract-CoT (Warm-up + RL)Model=Qwen3-4B, Tokens=1412026.04 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=DeepSeek-R1-Distill-Qwen-1.5B, RL Setting=Task reward only2026.02 | 89.63 | — | — | — | — | — | — | — | — | 56.05 | — | 5.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fixed TokensSetting=2k tokens, Backbone=Qwen3-14B2026.01 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 2,673 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Bidirectional Curriculum Generation (Round 3)Data Volume=4,5942026.03 | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Bidirectional Curriculum Generation (Round 4)Data Volume=5,8732026.03 | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPOModel=Qwen3-4B, Temperature=Constant, Maximum context length=8K tokens2026.01 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | 31.3 | — | — | — | — | — | — | 3,181 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stepwise InternalizationModel=Qwen3-8B, Tokens=1692026.04 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-4B (RL-No-Think)Training=RL, Mode=No-Think, Test Setting=No-think2026.01 | 88.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,234 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT (CoT)Model=Qwen3-4B, Tokens=13962026.04 | 88.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwQ-32BBackbone=QwQ-32B2026.02 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3,318.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Evo-L2S (Accuracy)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1,792.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |