Multi-hop Question Answering on 2WikiMultiHopQA (Contain-Acc, GPT-Acc)
67.1Containment AccuracyOurs
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ours2026.06 | 67.1 | 64.8 | |
| GFM-RAG2026.06 | 66.8 | 59.6 | |
| HippoRAG2026.06 | 66.1 | 59.9 | |
| HippoRAG22026.06 | 62.7 | 55 | |
| LightRAG2026.06 | 55.2 | 39 | |
| E2GraphRAG2026.06 | 54.3 | 38.1 | |
| RAPTOR2026.06 | 50.1 | 42.1 | |
| RetrievalTop-k=52026.06 | 48.6 | 43 | |
| G-retriever2026.06 | 46.6 | 27.1 | |
| RetrievalTop-k=32026.06 | 44.9 | 39.7 | |
| RetrievalTop-k=12026.06 | 36.6 | 31.7 | |
| GPT-4o-miniModel=GPT-4o-mini2026.06 | 36.3 | 31.4 | |
| llama-8BModel=llama-8B2026.06 | 33.6 | 16.2 | |
| KGP2026.06 | 31.6 | 30 | |
| GPT-3.5-turboModel=GPT-3.5-turbo2026.06 | 28.7 | 31 | |
| llama-13BModel=llama-13B2026.06 | 21.9 | 10.5 |