Natural Language Graph Reasoning on NLGraph (test)
37.6AccuracySingle Best
Evaluation Results
| Method | Links | |
|---|---|---|
| Single BestBase model=Qwen2.5-1.5B2026.05 | 37.6 | |
| PSO-MergingBase model=Qwen2.5-1.5B2026.05 | 35.2 | |
| MTLBase model=Qwen2.5-1.5B2026.05 | 31.9 | |
| TIESBase model=Qwen2.5-1.5B2026.05 | 31.6 | |
| Model SwarmBase model=Qwen2.5-1.5B2026.05 | 29.7 | |
| EvoGMBase model=Qwen2.5-1.5B2026.05 | 29 | |
| Task ArithmeticBase model=Qwen2.5-1.5B2026.05 | 28.6 | |
| DAREBase model=Qwen2.5-1.5B2026.05 | 28.6 | |
| BaseBase model=Qwen2.5-1.5B2026.05 | 28.4 | |
| CMABase model=Qwen2.5-1.5B2026.05 | 27.5 | |
| Model SoupBase model=Qwen2.5-1.5B2026.05 | 19.7 | |
| EvoGMBackbone=Qwen2.5-1.5B2026.05 | 0.537 | |
| PSO-MergingBackbone=Qwen2.5-1.5B2026.05 | 0.465 | |
| CMABackbone=Qwen2.5-1.5B2026.05 | 0.445 | |
| Single BestBackbone=Qwen2.5-1.5B2026.05 | 0.376 | |
| Model SwarmBackbone=Qwen2.5-1.5B2026.05 | 0.373 | |
| MTLBackbone=Qwen2.5-1.5B2026.05 | 0.319 | |
| TIESBackbone=Qwen2.5-1.5B2026.05 | 0.316 | |
| TABackbone=Qwen2.5-1.5B2026.05 | 0.286 | |
| DAREBackbone=Qwen2.5-1.5B2026.05 | 0.286 | |
| BaseBackbone=Qwen2.5-1.5B2026.05 | 0.284 | |
| Model SoupBackbone=Qwen2.5-1.5B2026.05 | 0.197 |