Mathematical Reasoning on MATH 500 (Accuracy and Response Length)
79.6AccuracyEvo-L2S-02
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Evo-L2S-02Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=022026.04 | 79.6 | 1,367.8 | |
| Evo-L2S (Accuracy)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Accuracy2026.04 | 77.4 | 1,758.2 | |
| Evo-L2S-01Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=012026.04 | 77.2 | 1,329.9 | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.04 | 73 | 2,570 | |
| ACM-TAModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 73 | 1,835 | |
| TIES-MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 72.2 | 1,757.5 | |
| Average MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 71.4 | 1,651 | |
| Evo-L2S-03Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=032026.04 | 70.8 | 1,225.1 | |
| ACM-TIESModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 69.4 | 1,586 | |
| ACM-AverageModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 69 | 1,370.6 | |
| Task ArithmeticModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 66.6 | 2,731.9 | |
| Evo-L2S (Length)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Length2026.04 | 62.6 | 782.9 | |
| Evo-L2S-04Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=042026.04 | 61.2 | 861.3 | |
| Qwen2.5-Math-1.5BModel Scale=1.5B2026.04 | 51.2 | 327.2 |