Multi-hop Question Answering on 2Wiki
74.9Exact MatchG-reasoner
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| G-reasonerReasoning LLM=GPT-4o-mini2025.09 | 74.9 | 82.1 | — | — | |
| G-reasoner2025.09 | 74.9 | 82.1 | — | 0.058 | |
| SAFEBackbone=Qwen 2.5 14B2026.04 | 72.8 | 81.7 | 91 | — | |
| SAFEBackbone=Qwen 3 8B2026.04 | 71.5 | 80.8 | 90.3 | — | |
| SAFEBackbone=Qwen 3 4B2026.04 | 70.8 | 79.8 | 89.4 | — | |
| SAFEBackbone=Gemma 3 12B2026.04 | 70.6 | 79.9 | 90 | — | |
| GFM-RAGMethod Type=Graph-enhanced Methods, Reasoning LLM=GPT-4o-mini2025.09 | 69.8 | 77.7 | — | — | |
| SAFEBackbone=Llama 3.1 8B2026.04 | 69.1 | 77.8 | 90.2 | — | |
| KAGMethod Type=Graph-enhanced Methods, Reasoning LLM=GPT-4o-mini2025.09 | 67.3 | 75.1 | — | — | |
| Self-FeedbackBackbone=Qwen 3 4B2026.04 | 65.9 | 74.9 | 82.8 | — | |
| No FeedbackBackbone=Qwen 3 4B2026.04 | 65.8 | 75.8 | 84.2 | — | |
| Self-FeedbackBackbone=Qwen 3 8B2026.04 | 64 | 73.4 | 82.9 | — | |
| Self-FeedbackBackbone=Qwen 2.5 14B2026.04 | 63.2 | 72.2 | 80.6 | — | |
| SubgraphRAGMethod Type=Graph-enhanced Methods, Reasoning LLM=GPT-4o-mini2025.09 | 62.7 | 69 | — | — | |
| ChainRAG (CxtInt)LLM=GLM-4-Plus, Answering Strategy=CxtInt2025.02 | 61.5 | 70.58 | — | — | |
| HippoRAG 2Method Type=Graph-enhanced Methods, Reasoning LLM=GPT-4o-mini2025.09 | 60.5 | 69.7 | — | — | |
| HippoRAGMethod Type=Graph-enhanced Methods, Reasoning LLM=GPT-4o-mini2025.09 | 59.4 | 67.3 | — | — | |
| R1-searcher2025.09 | 58.3 | 71.1 | — | 0.713 | |
| ChainRAG (AnsInt)LLM=GLM-4-Plus, Answering Strategy=AnsInt2025.02 | 58 | 67.35 | — | — | |
| Search-o1Backbone=QwQ 32B, Retriever=Bing Web Search2025.05 | 58 | 71.4 | — | — | |
| ESearchBackbone=Qwen2.5-3b, Model Variant=Base, Retrieval Setting=Online2025.10 | 57.7 | 67.9 | — | — | |
| Qwen3-EmbMethod Type=Non-structure Methods, Reasoning LLM=GPT-4o-mini, Parameters=8B2025.09 | 57.2 | 63.2 | — | — | |
| ITER-RETGENLLM=GLM-4-Plus, Iterations=32025.02 | 56.5 | 66.56 | — | — | |
| ChainRAG (CxtInt)LLM=Qwen2.5-72B, Answering Strategy=CxtInt2025.02 | 55.5 | 65.85 | — | — | |
| HippoRAG w/ IRCoTLLM=GLM-4-Plus2025.02 | 55.5 | 67.55 | — | — | |
| No FeedbackBackbone=Qwen 2.5 14B2026.04 | 55.4 | 71 | 87.2 | — | |
| Search-R12025.09 | 54.6 | 68.7 | — | 0.652 | |
| LongRAGLLM=GLM-4-Plus2025.02 | 54.5 | 62.27 | — | — | |
| Self-FeedbackBackbone=Gemma 3 12B2026.04 | 54.3 | 65 | 73.3 | — | |
| Self-FeedbackBackbone=Llama 3.1 8B2026.04 | 54.2 | 65 | 73.2 | — | |
| ChainRAG (AnsInt)LLM=Qwen2.5-72B, Answering Strategy=AnsInt2025.02 | 54 | 64.23 | — | — | |
| No FeedbackBackbone=Qwen 3 8B2026.04 | 53.7 | 66.6 | 85.6 | — | |
| Quest-GNN(Ours)Inference Model=GPT-4o-mini2025.10 | 53.52 | 61.63 | — | — | |
| Mujica-MyGOBackbone=Qwen 2.5-7B, Retriever=bge-large-en-v1.5, Domain Setting=In-domain2025.05 | 53.17 | 59.62 | — | — | |
| SEARCH-RBackbone=Llama-3.1-8B+GPT-4o-mini2026.04 | 52.5 | 63.86 | — | — | |
| ESearchBackbone=Qwen2.5-3b, Model Variant=Instruct, Retrieval Setting=Online2025.10 | 52.2 | 64.1 | — | — | |
| EvalActBackbone=Qwen2.5-7B-Instruct2026.03 | 52.1 | — | — | — | |
| ChainRAG (AnsInt)LLM=GPT4o-mini, Answering Strategy=AnsInt2025.02 | 52 | 62.55 | — | — | |
| HippoRAG w/ IRCoTLLM=Qwen2.5-72B2025.02 | 52 | 64.19 | — | — | |
| ChainRAGBackbone=DeepSeek-V32026.04 | 52 | 61.4 | — | — | |
| LongRAGLLM=Qwen2.5-72B2025.02 | 51.5 | 62 | — | — | |
| SEARCH-RBackbone=Llama-3.1-8B+DeepSeek-V32026.04 | 51.5 | 62.49 | — | — | |
| HippoRAG2Inference Model=GPT-4o-mini2025.10 | 51.49 | 60.18 | — | — | |
| No FeedbackBackbone=Llama 3.1 8B2026.04 | 51 | 59.6 | 67.5 | — | |
| GraphRAGInference Model=GPT-4o-mini2025.10 | 50.99 | 58.08 | — | — | |
| GTE-Qwen2-7BInference Model=GPT-4o-mini2025.10 | 50.75 | 52.37 | — | — | |
| No FeedbackBackbone=Gemma 3 12B2026.04 | 50.7 | 65.1 | 79.4 | — | |
| ITER-RETGENLLM=GPT4o-mini, Iterations=32025.02 | 50.5 | 58.43 | — | — | |
| ChainRAG (CxtInt)LLM=GPT4o-mini, Answering Strategy=CxtInt2025.02 | 50.5 | 56.54 | — | — | |
| Tree-GRPOBackbone=Qwen2.5-14b2025.09 | 50.5 | — | — | — | |
| Iter-RetGenBackbone=GPT-4o-mini2026.04 | 50.5 | 58.43 | — | — | |
| GSPOBackbone=Qwen2.5-14b2025.09 | 50.2 | — | — | — | |
| RAG-GymBackbone=Llama 3.1-8B, Retriever=bge-base + BM252025.05 | 50.2 | 57.9 | — | — | |
| Mujica w/ warm upBackbone=Qwen 2.5-7B, Retriever=bge-large-en-v1.5, Domain Setting=In-domain2025.05 | 50.18 | 56.25 | — | — | |
| EvalActBackbone=Qwen2.5-3B-Instruct2026.03 | 50 | — | — | — | |
| R-SearchBackbone=Qwen2.5-3b, Model Variant=Instruct, RL Strategy=PPO, Retrieval Setting=Online2025.10 | 49.8 | 56 | — | — | |
| GraphRAG (drift)KG Source=GPT-4o2024.10 | 49.7 | 62.9 | — | — | |
| HippoRAGKG Source=GPT-4o2024.10 | 49.3 | 62.7 | — | — | |
| NV-Embed-v2Inference Model=GPT-4o-mini2025.10 | 49.22 | 51.51 | — | — | |
| LongRAGLLM=GPT4o-mini2025.02 | 49 | 62.39 | — | — | |
| HippoRAG w/ IRCoTLLM=GPT4o-mini2025.02 | 48 | 62.38 | — | — | |
| NaiveRAG w/ QDLLM=GLM-4-Plus, Question Decomposition=true2025.02 | 48 | 60.93 | — | — | |
| HippoRAGBackbone=GPT-4o-mini2026.04 | 48 | 62.38 | — | — | |
| ChainRAGBackbone=GPT-4o-mini2026.04 | 48 | 56.61 | — | — | |
| BM25Method Type=Non-structure Methods, Reasoning LLM=GPT-4o-mini2025.09 | 47.9 | 51.2 | — | — | |
| HippoRAGBackbone=GPT 3.5-turbo, Retriever=ColBERTv22025.05 | 47.7 | 62.7 | — | — | |
| ReSearchBackbone=Qwen 2.5-7B, Retriever=FlashRAG2025.05 | 47.6 | — | — | — | |
| R-SearchBackbone=Qwen2.5-3b, Model Variant=Instruct, RL Strategy=GRPO, Retrieval Setting=Online2025.10 | 46 | 52.1 | — | — | |
| NaiveRAGLLM=GLM-4-Plus2025.02 | 45.5 | 57.78 | — | — | |
| TRACEBackbone=Llama 3 8B2026.04 | 45.5 | 56.4 | — | — | |
| RAPTORInference Model=GPT-4o-mini2025.10 | 45.43 | 56.24 | — | — | |
| IterDRAGBackbone=Gemini 1.5, Retriever=Gecko 1B2025.05 | 44.3 | 54.6 | — | — | |
| StepSearchBackbone=Qwen2.5-3b, Model Variant=Base, Retrieval Setting=Online2025.10 | 44.1 | 56.4 | — | — | |
| Graph + LLMKG Source=D-SynthKG-8b2024.10 | 44 | 54.4 | — | — | |
| GFM-RAGInference Model=GPT-4o-mini2025.10 | 43.79 | 53.26 | — | — | |
| Tree-GRPOBackbone=Qwen2.5-3b2025.09 | 43.7 | — | — | — | |
| LlamaIndexKG Source=D-SynthKG-8b2024.10 | 43.5 | 52.8 | — | — | |
| GraphRAG (local)KG Source=GPT-4o2024.10 | 43.2 | 49.1 | — | — | |
| Waypoint Coverage RewardBackbone=Qwen3-8B2026.05 | 43.2 | 53.3 | — | — | |
| ESearchBackbone=Qwen2.5-3b, Model Variant=Base, Retrieval Setting=Offline2025.10 | 42.8 | 50 | — | — | |
| Waypoint Coverage RewardBackbone=Search-R1-7B2026.05 | 42.8 | 51 | — | — | |
| GRPOBackbone=Qwen2.5-14b2025.09 | 42.6 | — | — | — | |
| NaiveRAGLLM=GPT4o-mini2025.02 | 42.5 | 50.61 | — | — | |
| NativeRAGBackbone=GPT-4o-mini2026.04 | 42.5 | 50.61 | — | — | |
| Tree-GRPOBackbone=Qwen2.5-7b2025.09 | 42.3 | — | — | — | |
| SSPBackbone=Qwen3-8B2026.05 | 42.2 | 51.2 | — | — | |
| LlamaIndexKG Source=Llama-3-70b2024.10 | 41.7 | 50.7 | — | — | |
| ESearchBackbone=Qwen2.5-3b, Model Variant=Instruct, Retrieval Setting=Offline2025.10 | 41.6 | 49.9 | — | — | |
| ITER-RETGENLLM=Qwen2.5-72B, Iterations=32025.02 | 41.5 | 53.59 | — | — | |
| Dense + LLMKG Source=None2024.10 | 41.4 | 53.1 | — | — | |
| Search-R1Backbone=Qwen2.5-7B-Instruct2026.03 | 41.4 | — | — | — | |
| Search-R1Backbone=Qwen 2.5-7B, Retriever=E52025.05 | 41.4 | — | — | — | |
| Chain-of-TripletKG Source=D-SynthKG-8b2024.10 | 41 | 50.7 | — | — | |
| GRPOBackbone=Qwen2.5-7b2025.09 | 40.7 | — | — | — | |
| StepSearchBackbone=Qwen2.5-3b, Model Variant=Instruct, Retrieval Setting=Online2025.10 | 40.6 | 50.1 | — | — | |
| Qwen3-8BBackbone=Qwen3-8B2026.05 | 40.6 | 50.8 | — | — | |
| AutoRefineBackbone=Qwen2.5-7B-Instruct2026.03 | 40.5 | — | — | — | |
| SSPBackbone=Search-R1-7B2026.05 | 40.4 | 49.3 | — | — | |
| Graph + LLMKG Source=Llama-3-70b2024.10 | 40 | 50.1 | — | — | |
| GSPOBackbone=Qwen2.5-3b2025.09 | 39.8 | — | — | — |