Question Answering on Mixed Dataset (NQ, PopQA, HotpotQA, 2Wiki) (test)
71.6AccuracyEA-GraphRAG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EA-GraphRAGCategory=Ours, QA Model=GPT-4o-mini, top-k=52026.02 | 71.6 | 76.9 | |
| HippoRAG2Category=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 68.5 | 73.6 | |
| ColBERTv2Category=RAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 65.3 | 70.2 | |
| HippoRAGCategory=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 63.5 | 69.1 | |
| LightRAGCategory=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 59.6 | 66.7 | |
| ContrieverCategory=RAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 56.1 | 62.2 | |
| BM25Category=RAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 54.2 | 59.9 | |
| RAPTORCategory=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 53.4 | 59.1 | |
| KGPCategory=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 53.1 | 59.2 | |
| G-retrieverCategory=GraphRAG Baselines, QA Model=GPT-4o-mini, top-k=52026.02 | 47.7 | 44.7 | |
| GPT-3.5-turboCategory=Large Language Models2026.02 | 41.8 | 44.3 | |
| GPT-4o-miniCategory=Large Language Models2026.02 | 39.5 | 43.4 | |
| Qwen3-8BCategory=Large Language Models2026.02 | 30.5 | 28.9 | |
| Llama-3-8BCategory=Large Language Models2026.02 | 19.6 | 17.6 |