Multi-task Generalization on Multi-task Overall Average
40.5AccuracySingle Best
Evaluation Results
| Method | Links | |
|---|---|---|
| Single BestBase model=Qwen2.5-1.5B2026.05 | 40.5 | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 38 | |
| CMABase model=Qwen2.5-1.5B2026.05 | 37.5 | |
| PSO-MergingBase model=Qwen2.5-1.5B2026.05 | 37.2 | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 37.2 | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 36.4 | |
| DAREBase model=Qwen2.5-1.5B2026.05 | 36.4 | |
| TIESBase model=Qwen2.5-1.5B2026.05 | 35.6 | |
| BaseBase model=Qwen2.5-1.5B2026.05 | 35.2 | |
| Model SoupBase model=Qwen2.5-1.5B2026.05 | 35 | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 33 |