General Language Understanding on IFEval, GSM8K, M-MMLU, M-ARC, M-HellaSwag, XSTest
1.015Average Normalized PerformanceMETIS
Evaluation Results
| Method | Links | |
|---|---|---|
| METISCategory=Ours, Backbone=Llama-3.2-3B2026.06 | 1.015 | |
| TSV-MCategory=State-of-the-Art (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.953 | |
| ConsensusTACategory=Conventional Method (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.945 | |
| Iso-CCategory=State-of-the-Art (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.941 | |
| TIESCategory=Conventional Method (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.938 | |
| FedMergeCategory=Iterative / FL, Backbone=Llama-3.2-3B2026.06 | 0.928 | |
| Iso-CTSCategory=State-of-the-Art (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.92 | |
| DARECategory=Conventional Method (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.914 | |
| ColD FusionCategory=Iterative / FL, Backbone=Llama-3.2-3B2026.06 | 0.911 | |
| TA + Subspace BoostingCategory=State-of-the-Art (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.885 | |
| TULU 3Category=Data-Mixing, Backbone=Llama-3.2-3B2026.06 | 0.884 | |
| q-FedAvgCategory=Iterative / FL, Backbone=Llama-3.2-3B2026.06 | 0.858 | |
| Task ArithmeticCategory=Conventional Method (+Many-shot), Backbone=Llama-3.2-3B2026.06 | 0.857 |