Multi-hop Question Answering on HotpotQA (Accuracy and Avg. Tokens)
88AccuracyRouteGoT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RouteGoTModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 88 | — | 4,566 | |
| GoT*Backbone=Qwen3-30B2026.03 | 87 | — | 10,864 | |
| CoTBackbone=Qwen3-30B2026.03 | 86 | — | 1,682 | |
| RouteLLMModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 83 | — | 4,479 | |
| IOBackbone=Qwen3-30B2026.03 | 81 | — | 1,685 | |
| KNNModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 79 | — | 4,604 | |
| RTRModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 79 | — | 4,480 | |
| RandomModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 77 | — | 6,656 | |
| EmbedLLMModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 77 | — | 7,405 | |
| AGoTBackbone=Qwen3-30B2026.03 | 72 | — | 25,269 | |
| ACEBackbone=LLaMA-3.1-8B-Instruct2026.01 | 62.8 | 3,271 | — | |
| ToTBackbone=Qwen3-30B2026.03 | 60 | — | 2,416 | |
| RAGBackbone=LLaMA-3.1-8B-Instruct2026.01 | 38.9 | 723 | — | |
| IterDRAGBackbone=LLaMA-3.1-8B-Instruct2026.01 | 38.9 | 723 | — | |
| VanillaBackbone=LLaMA-3.1-8B-Instruct2026.01 | 25.7 | 194 | — |