Multi-hop Question Answering on HotpotQA (LLM-Acc, Match-Acc)
86.7LLM AccuracyMoG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MoGBackbone=DeepSeek-V32026.05 | 86.7 | 73.6 | |
| Youtu-GraphRAGBackbone=DeepSeek-V32026.05 | 83.7 | 71.6 | |
| HippoRAG2Backbone=DeepSeek-V32026.05 | 81.8 | 70.2 | |
| HippoRAGBackbone=DeepSeek-V32026.05 | 81.7 | 69 | |
| RAPTORBackbone=DeepSeek-V32026.05 | 80.9 | 67.3 | |
| LightRAGBackbone=DeepSeek-V32026.05 | 71.9 | 66.2 | |
| E2GraphRAGBackbone=DeepSeek-V32026.05 | 68.7 | 65.7 | |
| Ours2026.06 | 63.5 | — | |
| HippoRAG22026.06 | 62.9 | — | |
| GFM-RAG2026.06 | 62.7 | — | |
| KGP2026.06 | 61.5 | — | |
| E2GraphRAG2026.06 | 61 | — | |
| LightRAG2026.06 | 60.3 | — | |
| HippoRAG2026.06 | 57 | — | |
| RAPTOR2026.06 | 55.9 | — | |
| RetrievalTop-k=52026.06 | 55.7 | — | |
| Zero-shot LLMBackbone=DeepSeek-V32026.05 | 53.7 | 48.2 | |
| RetrievalTop-k=32026.06 | 53 | — | |
| G-retrieverBackbone=DeepSeek-V32026.05 | 49.9 | 45.9 | |
| RetrievalTop-k=12026.06 | 46.3 | — | |
| G-retriever2026.06 | 42.2 | — | |
| GPT-4o-miniModel=GPT-4o-mini2026.06 | 38.9 | — | |
| GPT-3.5-turboModel=GPT-3.5-turbo2026.06 | 33.4 | — | |
| llama-8BModel=llama-8B2026.06 | 31.1 | — | |
| llama-13BModel=llama-13B2026.06 | 24.2 | — |