General Knowledge on Knowledge Benchmarks (ARC-C, ARC-E, MMLU, GPQA) (test)
83.05ARC-CTask Arithmetic
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Task ArithmeticMerging=Task Arithmetic, Model Family=Llama3.1-8B2026.01 | 83.05 | 90.83 | 63.69 | 39.39 | — | |
| LinearMerging=Linear, Model Family=Llama3.1-8B2026.01 | 80.68 | 89.77 | 61.5 | 38.64 | — | |
| LEDMerging=LED, Model Family=Llama3.1-8B2026.01 | 80.34 | 89.77 | 63.45 | 9.85 | — | |
| FuseLLMMerging=FuseLLM, Model Family=Llama3.1-8B2026.01 | 80 | 89.59 | 61.69 | 0 | — | |
| Finance (WiroAI-Finance-Llama-8B)Model Family=Llama3.1-8B2026.01 | 79.66 | 89.24 | 60.6 | 25.76 | — | |
| ReasonAnyMerging=ReasonAny, Model Family=Llama3.1-8B2026.01 | 79.32 | 89.24 | 64.59 | 43.18 | — | |
| DAREMerging=DARE, Model Family=Llama3.1-8B2026.01 | 77.29 | 88.36 | 59.64 | 36.36 | — | |
| TIESMerging=TIES, Model Family=Llama3.1-8B2026.01 | 73.9 | 86.07 | 55.75 | 34.09 | — | |
| Reasoning (DeepSeek-R1-Distill-Llama-8B)Model Family=Llama3.1-8B2026.01 | 70.85 | 83.95 | 53.25 | 47.51 | — | |
| ReasoningModel Type=Domain Expert (DeepSeek-R1-Distill-Qwen-7B)2026.01 | 64.75 | 77.25 | 52.51 | 49.1 | — | |
| ReasonAnyMethod Class=Model Merging2026.01 | 64.31 | 73.39 | 73.46 | 44.85 | — | |
| Task ArithmeticMethod Class=Model Merging2026.01 | 63.56 | 70.43 | 61.81 | 37.88 | — | |
| BiomedicineModel Type=Domain Expert (Meditron3-Qwen2.5-7B)2026.01 | 60.34 | 67.02 | 71.51 | 40.15 | — | |
| LinearMethod Class=Model Merging2026.01 | 60.34 | 66.19 | 57.04 | 24.24 | — | |
| LEDMethod Class=Model Merging2026.01 | 32.54 | 33.89 | 71.93 | 38.64 | — | |
| TIESMethod Class=Model Merging2026.01 | 21.36 | 26.63 | 22.95 | 34.09 | — | |
| DAREMethod Class=Model Merging2026.01 | 17.97 | 13.93 | 23.46 | 2.27 | — | |
| FuseLLMMethod Class=Model Merging2026.01 | 0 | 0 | 22.95 | 0 | — |