Model Merging on 7-task NLP benchmark
1.18Avg PerformanceMETIS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| METISBackbone=Qwen-3-4B2026.06 | 1.18 | 0.92 | -0.26 | |
| TIESBackbone=Qwen-3-4B2026.06 | 1.108 | 0.886 | -0.22 | |
| ConsensusTABackbone=Qwen-3-4B2026.06 | 1.067 | 0.75 | -0.32 | |
| Task ArithmeticBackbone=Qwen-3-4B2026.06 | 1.048 | 0.75 | -0.3 | |
| METISBackbone=Llama-3.2-3B2026.06 | 1.015 | 0.872 | -0.14 | |
| DAREBackbone=Qwen-3-4B2026.06 | 0.986 | 0.614 | -0.37 | |
| ConsensusTABackbone=Llama-3.2-3B2026.06 | 0.942 | 0.641 | -0.3 | |
| METISBackbone=Llama-3.1-8B2026.06 | 0.935 | 0.585 | -0.35 | |
| TIESBackbone=Llama-3.2-3B2026.06 | 0.883 | 0.375 | -0.51 | |
| TIESBackbone=Llama-3.1-8B2026.06 | 0.852 | 0.39 | -0.46 | |
| DAREBackbone=Llama-3.1-8B2026.06 | 0.838 | 0.634 | -0.2 | |
| DAREBackbone=Llama-3.2-3B2026.06 | 0.807 | 0.542 | -0.27 | |
| METISBackbone=Gemma-2-2B2026.06 | 0.8 | 0.525 | -0.28 | |
| ConsensusTABackbone=Gemma-2-2B2026.06 | 0.752 | 0.4 | -0.35 | |
| TIESBackbone=Gemma-2-2B2026.06 | 0.726 | 0.275 | -0.45 | |
| Task ArithmeticBackbone=Llama-3.2-3B2026.06 | 0.706 | 0.385 | -0.32 | |
| Task ArithmeticBackbone=Llama-3.1-8B2026.06 | 0.704 | 0.39 | -0.31 | |
| ConsensusTABackbone=Llama-3.1-8B2026.06 | 0.694 | 0.293 | -0.4 | |
| DAREBackbone=Gemma-2-2B2026.06 | 0.663 | 0.375 | -0.29 | |
| Task ArithmeticBackbone=Gemma-2-2B2026.06 | 0.521 | 0.08 | -0.44 |