Mathematical Reasoning on CollegeMath (test)
49.5AccuracyAverage Merging
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Average MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 49.5 | 911.1 | |
| ACM-TAModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 49.5 | 926.5 | |
| Evo-L2S-03Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 49.2 | 860.7 | |
| ACM-TIESModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 48.9 | 849.7 | |
| TIES-MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 48.5 | 991.7 | |
| TATAModel=Qwen2.5Math-7B2025.02 | 48.3 | — | |
| Evo-L2S-02Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 47.8 | 986.8 | |
| ACM-AverageModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 47.6 | 862.1 | |
| Evo-L2S-01Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 47.5 | 1,481.7 | |
| Evo-L2S (Accuracy)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 47.3 | 1,492.8 | |
| Task ArithmeticModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 47.2 | 1,539.1 | |
| hybridModel=Qwen2.5Math-7B2025.02 | 47.1 | — | |
| Evo-L2S-04Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 47.1 | 700.6 | |
| ensembleModel=Qwen2.5Math-7B2025.02 | 46.7 | — | |
| TATAModel=Qwen2.5-14B2025.02 | 46.4 | — | |
| ensembleModel=Qwen2.5-14B2025.02 | 46.1 | — | |
| hybridModel=Qwen2.5-14B2025.02 | 45.8 | — | |
| DeepSeek-R1-Distill-Qwen-7BModel Scale=7B2026.04 | 45.4 | 3,171.1 | |
| GPT-SelectModel=Qwen2.5Math-7B2025.02 | 44.4 | — | |
| hybridModel=Qwen2.5-7B2025.02 | 44.2 | — | |
| GPT-SelectModel=Qwen2.5-14B2025.02 | 44.1 | — | |
| ensembleModel=Qwen2.5Math-1.5B2025.02 | 44.1 | — | |
| Evo-L2S-05Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 44 | 725.7 | |
| TATAModel=Qwen2.5Math-1.5B2025.02 | 43.9 | — | |
| TATAModel=Qwen2.5-7B2025.02 | 43.4 | — | |
| hybridModel=Qwen2.5Math-1.5B2025.02 | 43.1 | — | |
| ensembleModel=Qwen2.5-7B2025.02 | 43 | — | |
| ensembleModel=Qwen2.5-3B2025.02 | 42.9 | — | |
| GPT-SelectModel=Qwen2.5-7B2025.02 | 42.7 | — | |
| DeepSeekMath-7B-VRTnumber of samples=0.59M, Base Model=DeepSeekMath-7B2024.06 | 41.9 | — | |
| Evo-L2S (Length)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 41.9 | 762.5 | |
| DeepSeekMath-RFTBackbone=DeepSeekMath-7B, #Samples=590K2026.04 | 41.9 | — | |
| GPT-SelectModel=Qwen2.5Math-1.5B2025.02 | 41.8 | — | |
| DeepSeekMath-CRPS-60KBackbone=DeepSeekMath-7B, #Samples=60K2026.04 | 41.8 | — | |
| hybridModel=Qwen2.5-3B2025.02 | 41.6 | — | |
| TATAModel=Qwen2.5-3B2025.02 | 41.6 | — | |
| DART-Math-DSMath-7B (Prop2Diff)number of samples=0.59M, Base Model=DeepSeekMath-7B, Sampling Strategy=Prop2Diff2024.06 | 40.7 | — | |
| DeepSeekMath-DARTBackbone=DeepSeekMath-7B, #Samples=590K2026.04 | 40.7 | — | |
| DART-Math-DSMath-7B (Uniform)number of samples=0.59M, Base Model=DeepSeekMath-7B, Sampling Strategy=Uniform2024.06 | 40.1 | — | |
| DeepSeekMath-CRPS-30KBackbone=DeepSeekMath-7B, #Samples=30K2026.04 | 40.1 | — | |
| MathFusionBackbone=DeepSeekMath-7B, #Samples=60K2026.04 | 39.8 | — | |
| DeepSeekMath-CRPS-15KBackbone=DeepSeekMath-7B, #Samples=15K2026.04 | 39.2 | — | |
| DeepSeekMath-DARTBackbone=DeepSeekMath-7B, #Samples=60K2026.04 | 39.1 | — | |
| GPT-SelectModel=Qwen2.5-3B2025.02 | 38.9 | — | |
| MathFusion (Sequential)Backbone=DeepSeekMath-7B, #Samples=30K2026.04 | 38.8 | — | |
| DART-Math-Llama3-70B (Uniform)number of samples=0.59M, Base Model=Llama3-70B, Sampling Strategy=Uniform2024.06 | 38.5 | — | |
| DART-Math-Llama3-70B (Prop2Diff)number of samples=0.59M, Base Model=Llama3-70B, Sampling Strategy=Prop2Diff2024.06 | 37.9 | — | |
| Llama3-70B-MMIQCnumber of samples=2.3M, Base Model=Llama3-70B2024.06 | 37.6 | — | |
| SIGMA-60KBackbone=DeepSeekMath-7B, #Samples=60K2026.04 | 37.2 | — | |
| DeepSeekMath-7B-Instructnumber of samples=0.78M, Base Model=DeepSeekMath-7B2024.06 | 37.1 | — | |
| DeepSeekMath-InstructBackbone=DeepSeekMath-7B, #Samples=780K2026.04 | 37.1 | — | |
| TATAModel=Qwen2.5-1.5B2025.02 | 37 | — | |
| Llama3-70B-VRTnumber of samples=0.59M, Base Model=Llama3-70B2024.06 | 36.8 | — | |
| hybridModel=Qwen2.5-1.5B2025.02 | 36.8 | — | |
| SIGMA-30KBackbone=DeepSeekMath-7B, #Samples=30K2026.04 | 36.7 | — | |
| ensembleModel=Qwen2.5-1.5B2025.02 | 36.6 | — | |
| DeepSeekMath-7B-MMIQCnumber of samples=2.3M, Base Model=DeepSeekMath-7B2024.06 | 35.3 | — | |
| DeepSeekMath-MMIQCBackbone=DeepSeekMath-7B, #Samples=2.3M2026.04 | 35.3 | — | |
| GPT-SelectModel=Qwen2.5-1.5B2025.02 | 35 | — | |
| DeepSeekMath-7B-ICLBase Model=DeepSeekMath-7B2024.06 | 34.7 | — | |
| TATAModel=LLaMA-3-8B2025.02 | 34.2 | — | |
| Llama3-70B-ICLBase Model=Llama3-70B2024.06 | 33.5 | — | |
| DeepSeekMath-MetaMathBackbone=DeepSeekMath-7B, #Samples=60K2026.04 | 33.2 | — | |
| Llama2-70B-Xwin-Math-V1.1+number of samples=1.4M, Base Model=Llama2-70B2024.06 | 33.1 | — | |
| Llama3-70B-MetaMathnumber of samples=0.40M, Base Model=Llama3-70B2024.06 | 31.9 | — | |
| hybridModel=LLaMA-3-8B2025.02 | 30.8 | — | |
| GPT-SelectModel=LLaMA-3-8B2025.02 | 30.6 | — | |
| ensembleModel=LLaMA-3-8B2025.02 | 29.6 | — | |
| Llama3-8B-MMIQCnumber of samples=2.3M, Base Model=Llama3-8B2024.06 | 29.5 | — | |
| DART-Math-Mistral-7B (Prop2Diff)number of samples=0.59M, Base Model=Mistral-7B, Sampling Strategy=Prop2Diff2024.06 | 29.4 | — | |
| DART-Math-Llama3-8B (Prop2Diff)number of samples=0.59M, Base Model=Llama3-8B, Sampling Strategy=Prop2Diff2024.06 | 28.8 | — | |
| VINEPPO + LILOTraining run=VINEPPO with LILO2025.02 | 28.8 | — | |
| Mistral-7B-MMIQCnumber of samples=2.3M, Base Model=Mistral-7B2024.06 | 28.5 | — | |
| Llama2-7B-Xwin-Math-V1.1+number of samples=1.4M, Base Model=Llama2-7B2024.06 | 27.6 | — | |
| hybridModel=Qwen2.5-0.5B2025.02 | 27.5 | — | |
| DART-Math-Llama3-8B (Uniform)number of samples=0.59M, Base Model=Llama3-8B, Sampling Strategy=Uniform2024.06 | 27.1 | — | |
| DART-Math-Mistral-7B (Uniform)number of samples=0.59M, Base Model=Mistral-7B, Sampling Strategy=Uniform2024.06 | 26.9 | — | |
| TATAModel=Qwen2.5-0.5B2025.02 | 26.9 | — | |
| VINEPPOTraining run=VINEPPO2025.02 | 26.9 | — | |
| PPO + LILOTraining run=PPO with LILO2025.02 | 26.4 | — | |
| Qwen2.5-Math-7BModel Scale=7B2026.04 | 26.2 | 759.4 | |
| ensembleModel=Qwen2.5-0.5B2025.02 | 25.6 | — | |
| PPOTraining run=PPO2025.02 | 25.4 | — | |
| GPT-4 (0314)Sampling=N/A2024.06 | 24.4 | — | |
| GPT-SelectModel=Qwen2.5-0.5B2025.02 | 24.4 | — | |
| Mistral-7B-VRTnumber of samples=0.59M, Base Model=Mistral-7B2024.06 | 24.2 | — | |
| Llama3-8B-VRTnumber of samples=0.59M, Base Model=Llama3-8B2024.06 | 23.9 | — | |
| Mistral-7B-WizardMath-V1.1 (RL)Base Model=Mistral-7B2024.06 | 23.1 | — | |
| Mistral-7B-MathScalenumber of samples=2.0M, Base Model=Mistral-7B2024.06 | 21.8 | — | |
| Llama3-8B-MetaMathnumber of samples=0.40M, Base Model=Llama3-8B2024.06 | 20.6 | — | |
| ORIGINAL SFTTraining run=SFT2025.02 | 20.3 | — | |
| Llama3-8B-ICLBase Model=Llama3-8B2024.06 | 19.9 | — | |
| Mistral-7B-MetaMathnumber of samples=0.40M, Base Model=Mistral-7B2024.06 | 19.3 | — | |
| Mistral-7B-ICLBase Model=Mistral-7B2024.06 | 17.9 | — |