Mathematical Reasoning on GSM8K (Accuracy, Avg Response Length)
85.7AccuracyEvo-L2S-01
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Evo-L2S-01Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=012026.04 | 85.7 | 409.5 | |
| Evo-L2S-02Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=022026.04 | 84.9 | 426.2 | |
| Evo-L2S (Accuracy)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Accuracy2026.04 | 84.7 | 543.6 | |
| Evo-L2S-03Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=032026.04 | 81.5 | 408.7 | |
| ACM-TAModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 80.2 | 576.3 | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.04 | 79 | 628.7 | |
| TIES-MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 78.8 | 595.8 | |
| Average MergingModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 78.2 | 533.1 | |
| ACM-TIESModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 78.2 | 469.8 | |
| Qwen2.5-Math-1.5BModel Scale=1.5B2026.04 | 75.7 | 110 | |
| ACM-AverageModel Scale=1.5B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 75.1 | 502.8 | |
| Task ArithmeticModel Scale=1.5B, Merging Strategy=Arithmetic Merging2026.04 | 75 | 1,219.2 | |
| Evo-L2S (Length)Model Scale=1.5B, Merging Strategy=Single-Objective Evolutionary Merging, Optimization Objective=Length2026.04 | 73.4 | 388.7 | |
| Evo-L2S-04Model Scale=1.5B, Merging Strategy=Multi-Objective Evolutionary Merging, Pareto Configuration Index=042026.04 | 73.3 | 385.5 |