Multi-hop Question Answering on Average (2WikiMQA, Bamboogle, Frames, MuSiQue)
54.8AccuracyTC+FM*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TC+FM*Model=Qwen-72B2026.02 | 54.8 | 63.75 | |
| TC+FM*Model=Qwen-32B2026.02 | 51.59 | 58.71 | |
| Search-o1Model=Qwen-72B2026.02 | 50.44 | 58.92 | |
| TC+FM*Model=Qwen-14B2026.02 | 50.21 | 56.43 | |
| Search-o1Model=Qwen-32B2026.02 | 46.63 | 55.18 | |
| TC+FM*Model=Qwen-7B2026.02 | 41.38 | 46.83 | |
| TC+FM*Model=Llama3.1-8B2026.02 | 40.71 | 46.48 | |
| Search-o1Model=Qwen-14B2026.02 | 40.27 | 48.92 | |
| Search-o1Model=Qwen-7B2026.02 | 36.61 | 43.29 | |
| Search-o1Model=Llama3.1-8B2026.02 | 35.17 | 40.95 | |
| Standard RAGModel=Qwen-72B2026.02 | 33.79 | 40.01 | |
| Naive GenModel=Qwen-72B2026.02 | 33.03 | 39.09 | |
| Naive GenModel=Llama3.1-8B2026.02 | 33.03 | 39.09 | |
| TC+FM*Model=Qwen-3B2026.02 | 32.16 | 30.41 | |
| Standard RAGModel=Qwen-32B2026.02 | 28.35 | 34.14 | |
| Naive GenModel=Qwen-32B2026.02 | 27.91 | 32.95 | |
| Standard RAGModel=Qwen-14B2026.02 | 26.04 | 32.85 | |
| Naive GenModel=Qwen-14B2026.02 | 25.7 | 30.3 | |
| Standard RAGModel=Qwen-7B2026.02 | 25.39 | 31.04 | |
| Search-o1Model=Qwen-3B2026.02 | 24.39 | 28.1 | |
| Standard RAGModel=Llama3.1-8B2026.02 | 23.91 | 28.9 | |
| Naive GenModel=Qwen-7B2026.02 | 20.67 | 22.62 | |
| Standard RAGModel=Qwen-3B2026.02 | 18.15 | 23.74 | |
| Naive GenModel=Qwen-3B2026.02 | 11.79 | 13.7 |