Multi-hop Question Answering on MoreHopQA
86.4AccuracyPAR2-RAG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PAR2-RAGgeneration_type=reasoning, generator=GPT-o32026.03 | 86.4 | — | |
| Coverage Anchorgeneration_type=reasoning, generator=GPT-o32026.03 | 86 | — | |
| ReActgeneration_type=reasoning, generator=GPT-o32026.03 | 83.2 | — | |
| Iterative Chaingeneration_type=reasoning, generator=GPT-o32026.03 | 83 | — | |
| PAR2-RAGGeneration Setting=Non-reasoning2026.03 | 82.6 | — | |
| Iterative ChainGeneration Setting=Non-reasoning2026.03 | 80 | — | |
| RouteGoTModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 77 | 3,396 | |
| IRCoTGeneration Setting=Non-reasoning2026.03 | 75.4 | — | |
| Coverage AnchorGeneration Setting=Non-reasoning2026.03 | 75.3 | — | |
| IRCoTgeneration_type=reasoning, generator=GPT-o32026.03 | 74.2 | — | |
| ReActGeneration Setting=Non-reasoning2026.03 | 74 | — | |
| GoT*Backbone=Qwen3-30B2026.03 | 73 | 4,275 | |
| RTRModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 73 | 2,468 | |
| KNNModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 71 | 2,494 | |
| RouteLLMModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 71 | 2,534 | |
| Direct Inferencegeneration_type=reasoning, generator=GPT-o32026.03 | 70.8 | — | |
| AGoTBackbone=Qwen3-30B2026.03 | 70 | 9,863 | |
| CoTgeneration_type=reasoning, generator=GPT-o32026.03 | 68.8 | — | |
| CoTBackbone=Qwen3-30B2026.03 | 68 | 439 | |
| EmbedLLMModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 65 | 6,842 | |
| RandomModel Pool={Qwen3-4B, 8B, 30B}2026.03 | 64 | 4,512 | |
| ToTBackbone=Qwen3-30B2026.03 | 61 | 2,027 | |
| CoTGeneration Setting=Non-reasoning2026.03 | 59.4 | — | |
| IOBackbone=Qwen3-30B2026.03 | 26 | 442 | |
| Direct InferenceGeneration Setting=Non-reasoning2026.03 | 14.4 | — |