Hardened Language Understanding on MMLU-Pro (val)
38.6AccuracySingle Best
Evaluation Results
| Method | Links | |
|---|---|---|
| Single BestBase model=Qwen2.5-1.5B2026.05 | 38.6 | |
| CMABase model=Qwen2.5-1.5B2026.05 | 35.7 | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 34.3 | |
| TIESBase model=Qwen2.5-1.5B2026.05 | 32.9 | |
| PSO-MergingBase model=Qwen2.5-1.5B2026.05 | 31.4 | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 31.4 | |
| Model SoupBase model=Qwen2.5-1.5B2026.05 | 30 | |
| DAREBase model=Qwen2.5-1.5B2026.05 | 30 | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 28.6 | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 28.6 | |
| BaseBase model=Qwen2.5-1.5B2026.05 | 27.1 |