Mathematical Reasoning on College Math
51.6AccuracySFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 51.6 | — | |
| Uni-DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 51.3 | — | |
| Uni-DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 51.3 | — | |
| PPOModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 50.8 | — | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 50.6 | — | |
| Dr. GRPO (Oat-Zero-7B)Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 50.4 | — | |
| SimpleRL-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 50.3 | — | |
| SimPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 50.1 | — | |
| SimPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 50.1 | — | |
| Eurus2-PRIMEModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 49.7 | — | |
| DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 49.5 | — | |
| DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 49.5 | — | |
| Iterative DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 48.9 | — | |
| OpenReasoner-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 48.7 | — | |
| Uni-DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 47.9 | — | |
| Evo-L2S-04Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 47.7 | 840 | |
| Evo-L2S-02Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=022026.04 | 47.7 | 948.5 | |
| ACM-TIESModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 47.5 | 899.8 | |
| ACM-AverageModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 47.4 | 937.9 | |
| Evo-L2S-01Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=012026.04 | 46.8 | 938.8 | |
| Evo-L2S-03Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=032026.04 | 46.8 | 822.2 | |
| SimPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 46.6 | — | |
| Evo-L2S-02Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 46.4 | 1,965.9 | |
| Evo-L2S-03Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 46.4 | 1,700.6 | |
| DeepSeek-R1-Distill-Qwen-14BModel Scale=14B, Merging Strategy=Distilled Model2026.04 | 46.1 | 2,671.1 | |
| Evo-L2S-05Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 46.1 | 696 | |
| Task ArithmeticModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 45.8 | 2,136.8 | |
| Evo-L2S-01Model Scale=14B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 45.8 | 2,129.9 | |
| Evo-L2S (Accuracy)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 45.7 | 2,307.6 | |
| Evo-L2S (Length)Model Scale=14B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 45.2 | 699.5 | |
| TIES-MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 45.1 | 1,231.7 | |
| Average MergingModel Scale=14B, Merging Strategy=Arithmetic Merging2026.04 | 45 | 1,210.7 | |
| ACM-TIESModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 44.9 | 992.1 | |
| TIES-MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 44.7 | 1,101.6 | |
| Evo-L2S (Accuracy)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Accuracy2026.04 | 43.7 | 1,259.4 | |
| Average MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 43.6 | 1,117.6 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 43.2 | — | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.04 | 42.8 | 1,776.6 | |
| ACM-AverageModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 42.8 | 950 | |
| Evo-L2S-04Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=042026.04 | 42.6 | 711.5 | |
| ACM-TAModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 42.3 | 1,183.4 | |
| Evo-L2S (Length)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Length2026.04 | 42.2 | 703.3 | |
| DAPO + RSPBackbone=Qwen2.5-Math-7B, Step Selection=peak step, Sampling Strategy=greedy2026.05 | 42.2 | — | |
| DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 41.9 | — | |
| CESBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 41.6 | 1,600 | |
| DAPOBackbone=Qwen2.5-Math-7B, Step Selection=peak step, Sampling Strategy=greedy2026.05 | 41.4 | — | |
| BaselineModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 40.5 | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 39.5 | 1,999 | |
| R1-7BBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 38.8 | 2,225 | |
| Entropy ShapeBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 38.7 | 1,850 | |
| Task ArithmeticModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 38.5 | 1,634.4 | |
| DAPOBackbone=DeepSeek-R1-Distill-1.5B2026.05 | 34.1 | 2,907 | |
| CESBackbone=DeepSeek-R1-Distill-1.5B2026.05 | 33.2 | 2,866 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=-2025.06 | 32.3 | — | |
| BaselineModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 32.3 | — | |
| ACM-TAModel Scale=14B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 32 | 3,892.2 | |
| BaseBackbone=Qwen2.5-Math-7B, Step Selection=peak step, Sampling Strategy=greedy2026.05 | 18.3 | — | |
| Qwen2.5-Math-1.5BModel Scale=1.5B2026.04 | 15.8 | 606.3 | |
| Qwen2.5-14BModel Scale=14B, Merging Strategy=Base Model2026.04 | 12.6 | 1,231.7 |