Mathematical Reasoning on MATH500 (Accuracy, Tokens)
94.6AccuracyS1
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| S1Base Model=QwQ-32B2026.05 | 94.6 | 4,549 | |
| TIPBase Model=QwQ-32B2026.05 | 93.8 | 4,155 | |
| PathCalBase Model=QwQ-32B2026.05 | 93.8 | 3,867 | |
| CyclicReflexBase Model=QwQ-32B2026.05 | 93.2 | 4,261 | |
| OriginalBase Model=QwQ-32B2026.05 | 92.8 | 4,209 | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 91 | 1,851 | |
| Evo-L2S (Accuracy)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 89 | 2,663.1 | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 88.6 | 2,391 | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 88.2 | 2,008 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 87.8 | 1,978 | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 87.4 | 1,281 | |
| Task ArithmeticModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 86.8 | 2,459.2 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 86.7 | 2,059 | |
| ThinkPrune-4k2026.03 | 86.6 | 2,042 | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 86.5 | 1,790 | |
| LAPO-D2026.03 | 86.4 | 2,365 | |
| Evo-L2S-01Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 86.4 | 2,429.8 | |
| LAPO-I2026.03 | 86.3 | 2,168 | |
| DeepSeek-R1-Distill-Qwen-14BModel Scale=14B, Merging Strategy=Distilled Model2026.04 | 86.2 | 3,183.6 | |
| Softmax+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 86.2 | — | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 86.2 | 1,406 | |
| DeepScaler-1.5B2026.03 | 85.8 | 3,280 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 85.8 | 1,459 | |
| ThinkPrune-I2k2026.03 | 85.5 | 1,707 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 85.5 | 1,423 | |
| Evo-L2S-02Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 85.4 | 2,272.6 | |
| DPOBackbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 85.4 | — | |
| Margin+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 85.2 | — | |
| All-Pairs+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 85 | — | |
| AutoThink2026.03 | 84.9 | 1,635 | |
| MPO+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 84.6 | — | |
| HAPO2026.03 | 84.4 | 2,370 | |
| Margin+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 84.4 | — | |
| Evo-L2S-03Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 83.8 | 1,958.2 | |
| All-Pairs+Backbone=qwen3-4b-base, nll coefficient=1.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 83.4 | — | |
| MPO+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 83.4 | — | |
| PathCalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 83.2 | 1,867 | |
| Evo-L2S-04Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 83 | 1,008.8 | |
| DPOBackbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 83 | — | |
| OriginalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 82.5 | 1,988 | |
| RFTBackbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 82 | — | |
| ACM-AverageModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 81.8 | 1,337.3 | |
| Average MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 81.6 | 1,692.4 | |
| ACM-TIESModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 81.6 | 1,273.7 | |
| Softmax+Backbone=qwen3-4b-base, nll coefficient=0.0, Setting=Online, Checkpoint selection=Highest checkpoint2026.04 | 81.6 | — | |
| TIPBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 81.4 | 1,932 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 81.4 | 2,038 | |
| Thinkless2026.03 | 81.3 | 2,944 | |
| S1Base Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 80.4 | 2,205 | |
| TIES-MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 80 | 1,837 | |
| ADaPTthinkBackbone=Qwen2.5-7B2026.06 | 78.2 | 1,541 | |
| SFT+GRPOBackbone=Qwen2.5-7B2026.06 | 77.4 | 1,466 | |
| Evo-L2S-05Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 77.2 | 680.2 | |
| ADaPTBackbone=Qwen2.5-7B2026.06 | 76.8 | 1,003 | |
| TLMREBackbone=Qwen2.5-7B2026.06 | 75.4 | 1,073 | |
| R-4BBackbone=Qwen2.5-7B2026.06 | 74.4 | 912 | |
| Evo-L2S (Length)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 74 | 695 | |
| ARMBackbone=Qwen2.5-7B2026.06 | 73.8 | 893 | |
| TL-1.5B-RLBudget=100%2025.10 | 73.5 | 2,020 | |
| ACM-TAModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 69.4 | 4,374.3 | |
| TL-1.5B-RLBudget=72.2%2025.10 | 69.2 | 1,775 | |
| TL-Warmup + DiffAdaptBudget=100%2025.10 | 68.3 | 1,003 | |
| TL-Warmup + DiffAdaptBudget=72.2%2025.10 | 68 | 973 | |
| TL-Warmup + DiffAdaptBudget=50.0%2025.10 | 67.6 | 954 | |
| ADaPTanswerBackbone=Qwen2.5-7B2026.06 | 67.2 | 427 | |
| ADaPTthinkBackbone=Qwen2.5-3B2026.06 | 66.8 | 1,492 | |
| SFT+GRPOBackbone=Qwen2.5-3B2026.06 | 66.4 | 1,483 | |
| TLMREBackbone=Qwen2.5-3B2026.06 | 64.6 | 1,178 | |
| ADaPTBackbone=Qwen2.5-3B2026.06 | 64.6 | 1,074 | |
| TL-Warmup + DiffAdaptBudget=33.3%2025.10 | 64.4 | 851 | |
| TL-1.5B-RLBudget=50.0%2025.10 | 63.3 | 1,460 | |
| ARMBackbone=Qwen2.5-3B2026.06 | 63 | 973 | |
| R-4BBackbone=Qwen2.5-3B2026.06 | 62.8 | 1,087 | |
| ADaPTanswerBackbone=Qwen2.5-3B2026.06 | 58.4 | 503 | |
| TL-1.5B-RLBudget=33.3%2025.10 | 55.6 | 1,039 | |
| Qwen2.5-14BModel Scale=14B, Merging Strategy=Base Model2026.04 | 49.6 | 598.4 | |
| BaseBackbone=Qwen2.5-7B2026.06 | 49.4 | 648 | |
| CoLDPolicy Model=Llama-3-70B-Instruct2025.07 | 49.2 | 313.2 | |
| CoLD(w/o Joint)Policy Model=Llama-3-70B-Instruct2025.07 | 48 | 370.4 | |
| Loose Lips Sink ShipsPolicy Model=Llama-3-70B-Instruct2025.07 | 45.8 | 435.7 | |
| Vanilla-Base-PRMPolicy Model=Llama-3-70B-Instruct2025.07 | 44.8 | 555.7 | |
| Length PenaltyPolicy Model=Llama-3-70B-Instruct2025.07 | 44.8 | 495.1 | |
| SFTBackbone=Qwen2.5-7B2026.06 | 44 | 632 | |
| Adaptive Length Bias MitigationPolicy Model=Llama-3-70B-Instruct2025.07 | 43 | 594.8 | |
| Uniform AveragePolicy Model=Llama-3-70B-Instruct2025.07 | 40.4 | 608.5 | |
| BaseBackbone=Qwen2.5-3B2026.06 | 40.2 | 593 | |
| Locally Weighted RegressionPolicy Model=Llama-3-70B-Instruct2025.07 | 39 | 590.7 | |
| CoLD(w/o Joint)Policy Model=MetaMath-Mistral-7B2025.07 | 38.6 | 353.4 | |
| Length PenaltyPolicy Model=MetaMath-Mistral-7B2025.07 | 37.6 | 448.8 | |
| CoLDPolicy Model=MetaMath-Mistral-7B2025.07 | 37.2 | 376.3 | |
| Vanilla-Base-PRMPolicy Model=MetaMath-Mistral-7B2025.07 | 37 | 555.2 | |
| Loose Lips Sink ShipsPolicy Model=MetaMath-Mistral-7B2025.07 | 34.5 | 441.2 | |
| Uniform AveragePolicy Model=MetaMath-Mistral-7B2025.07 | 33.2 | 609.9 | |
| CoLDPolicy Model=MuggleMath-13B2025.07 | 31.4 | 309.2 | |
| Adaptive Length Bias MitigationPolicy Model=MetaMath-Mistral-7B2025.07 | 31 | 610 | |
| CoLD(w/o Joint)Policy Model=MuggleMath-13B2025.07 | 31 | 329 | |
| SFTBackbone=Qwen2.5-3B2026.06 | 30.6 | 407 | |
| Vanilla-Base-PRMPolicy Model=MuggleMath-13B2025.07 | 30.4 | 411.1 | |
| Length PenaltyPolicy Model=MuggleMath-13B2025.07 | 30 | 376.1 | |
| Locally Weighted RegressionPolicy Model=MetaMath-Mistral-7B2025.07 | 29.6 | 507.3 |