Multi-task Reasoning on Average (2WikiMultiHop, MMLU, GSM8k) (in-distribution)
75.2AccuracyCONCUR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CONCURRouting=Unconstrained2025.12 | 75.2 | 36.5 | |
| Best single strategyRouting=Unconstrained2025.12 | 74.3 | 41.63 | |
| RTRRouting=Unconstrained2025.12 | 74.3 | 40.52 | |
| EmbedLLMRouting=Unconstrained2025.12 | 73.4 | 34.21 | |
| RouteLLMRouting=Unconstrained2025.12 | 53.5 | 10.2 | |
| VCOREModel=Qwen3 32B2025.10 | 41.29 | — | |
| DFTModel=Qwen3 32B2025.10 | 39.79 | — | |
| RandomModel=Qwen3 32B2025.10 | 36.94 | — | |
| VCOREModel=Qwen3 4B2025.10 | 36.09 | — | |
| SFTModel=Qwen3 32B2025.10 | 35.99 | — | |
| VCOREModel=Qwen3 8B2025.10 | 35.8 | — | |
| SFTModel=Qwen3 8B2025.10 | 35.74 | — | |
| iw-SFTModel=Qwen3 32B2025.10 | 35.62 | — | |
| DFTModel=Qwen3 8B2025.10 | 35.55 | — | |
| OriginalModel=Qwen3 32B2025.10 | 35.3 | — | |
| iw-SFTModel=Qwen3 8B2025.10 | 34.88 | — | |
| SFTModel=Qwen3 4B2025.10 | 33.82 | — | |
| RandomModel=Qwen3 8B2025.10 | 33.7 | — | |
| OriginalModel=Qwen3 8B2025.10 | 33.24 | — | |
| DFTModel=Qwen3 4B2025.10 | 32.49 | — | |
| iw-SFTModel=Qwen3 4B2025.10 | 32.43 | — | |
| RandomModel=Qwen3 4B2025.10 | 31.46 | — | |
| OriginalModel=Qwen3 4B2025.10 | 31 | — | |
| VCOREModel=LLaMA3.1 8B Instruct2025.10 | 11.38 | — | |
| iw-SFTModel=LLaMA3.1 8B Instruct2025.10 | 9.35 | — | |
| SFTModel=LLaMA3.1 8B Instruct2025.10 | 9.27 | — | |
| RandomModel=LLaMA3.1 8B Instruct2025.10 | 8.35 | — | |
| OriginalModel=LLaMA3.1 8B Instruct2025.10 | 8.02 | — | |
| DFTModel=LLaMA3.1 8B Instruct2025.10 | 5.54 | — |