Knowledge Reasoning on K-Cross (test)
41.5AccuracyCMA
Evaluation Results
| Method | Links | |
|---|---|---|
| CMABase model=Qwen2.5-1.5B2026.05 | 41.5 | |
| PSO-MergingBase model=Qwen2.5-1.5B2026.05 | 41.4 | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 41.1 | |
| PSO-MergingBackbone=Qwen2.5-1.5B2026.05 | 39.3 | |
| Single BestBase model=Qwen2.5-1.5B2026.05 | 39.2 | |
| Single BestBackbone=Qwen2.5-1.5B2026.05 | 39.2 | |
| CMABackbone=Qwen2.5-1.5B2026.05 | 39.2 | |
| Model SwarmBackbone=Qwen2.5-1.5B2026.05 | 39.2 | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 39.1 | |
| TABackbone=Qwen2.5-1.5B2026.05 | 39.1 | |
| DAREBase model=Qwen2.5-1.5B2026.05 | 39 | |
| DAREBackbone=Qwen2.5-1.5B2026.05 | 39 | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 38.8 | |
| EvoGMBackbone=Qwen2.5-1.5B2026.05 | 37.9 | |
| TIESBase model=Qwen2.5-1.5B2026.05 | 34.2 | |
| TIESBackbone=Qwen2.5-1.5B2026.05 | 34.2 | |
| Model SoupBase model=Qwen2.5-1.5B2026.05 | 33 | |
| Model SoupBackbone=Qwen2.5-1.5B2026.05 | 33 | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 32.7 | |
| MTLBackbone=Qwen2.5-1.5B2026.05 | 32.7 | |
| BaseBase model=Qwen2.5-1.5B2026.05 | 29.7 | |
| BaseBackbone=Qwen2.5-1.5B2026.05 | 29.7 |