Mathematical Reasoning on GSM8K (test) (Accuracy, Token Length)
0.924AccuracyEvo-L2S-02
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Evo-L2S-02Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 0.924 | 384 | |
| ACM-TAModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 0.923 | 354.1 | |
| Evo-L2S (Accuracy)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 0.922 | 526.7 | |
| Evo-L2S-01Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 0.92 | 531.2 | |
| Task ArithmeticModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 0.916 | 634.6 | |
| Evo-L2S-03Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 0.914 | 362.3 | |
| Average MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 0.911 | 370.1 | |
| DeepSeek-R1-Distill-Qwen-7BModel Scale=7B2026.04 | 0.899 | 1,794.3 | |
| TIES-MergingModel Scale=7B, Merging Strategy=Arithmetic Merging2026.04 | 0.899 | 360.3 | |
| ACM-AverageModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 0.876 | 369.6 | |
| ACM-TIESModel Scale=7B, Merging Strategy=Activation-informed Merging (ACM)2026.04 | 0.861 | 378.8 | |
| Evo-L2S-04Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 0.854 | 385.5 | |
| Evo-L2S (Length)Model Scale=7B, Merging Strategy=Single-Objective Evolutionary Merging2026.04 | 0.851 | 366 | |
| Qwen2.5-Math-7BModel Scale=7B2026.04 | 0.837 | 104 | |
| Evo-L2S-05Model Scale=7B, Merging Strategy=Multi-Objective Evolutionary Merging2026.04 | 0.82 | 378.5 |