Multi-hop Question Answering on 2WikiMultiHopQA (test)
73.9EMCJ
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CJBackbone=Qwen3-32B, Supervision Strategy=W.O. Gold Supervision2026.04 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-R1 (EM)Backbone=Qwen3-32B, Supervision Strategy=W. Gold Supervision2026.04 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCSBackbone=Qwen3-32B, Supervision Strategy=W.O. Gold Supervision2026.04 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=Qwen3-14B2026.06 | 69.8 | — | — | 76.2 | — | — | — | 76.4 | — | — | — | — | — | — | |
| ARBORBackbone=Qwen3-14B2026.06 | 69.8 | — | — | 76.3 | — | — | — | 77.3 | — | — | — | — | — | — | |
| DAPOBackbone=Qwen3-14B2026.06 | 67.6 | — | — | 73.4 | — | — | — | 72.9 | — | — | — | — | — | — | |
| Search-R1 (EM)Backbone=Qwen3-4B-Instruct-2507, Supervision Strategy=W. Gold Supervision2026.04 | 66.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TTRLBackbone=Qwen3-32B, Supervision Strategy=W.O. Gold Supervision2026.04 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=Qwen3-8B2026.06 | 64.8 | — | — | 71 | — | — | — | 71.1 | — | — | — | — | — | — | |
| QuCo-RAGBackbone=GPT-4.12025.12 | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARBORBackbone=Qwen3-4B2026.06 | 64.2 | — | — | 72.4 | — | — | — | 74.6 | — | — | — | — | — | — | |
| ARBORBackbone=Qwen3-8B2026.06 | 64.2 | — | — | 73.3 | — | — | — | 75.3 | — | — | — | — | — | — | |
| DAPOBackbone=Qwen3-8B2026.06 | 63.8 | — | — | 69.7 | — | — | — | 69.6 | — | — | — | — | — | — | |
| Workflow-R1-SearchMulti-turn=true, Backbone=Qwen2.5-32B-Instruct2026.02 | 63.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-o1Backbone=Qwen3-32B, Supervision Strategy=Model Inference2026.04 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RelinkMethod Type=Proposed, Backbone LLM=deepseek-v3-03242026.01 | 62.8 | — | — | 72.2 | — | — | — | — | — | — | — | — | — | — | |
| Graph-AdaptR1Backbone=Qwen2.5-7B-Instruct, Interaction Type=Training, Knowledge Representation=Graph-based2026.05 | 61.72 | — | — | 69.2 | — | — | — | — | — | — | — | — | — | — | |
| Search-R1 (EM)Backbone=Qwen2.5-7B-Instruct, Supervision Strategy=W. Gold Supervision2026.04 | 61.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPOBackbone=Qwen3-4B2026.06 | 60.9 | — | — | 68.3 | — | — | — | 67.6 | — | — | — | — | — | — | |
| CCSBackbone=Qwen3-4B-Instruct-2507, Supervision Strategy=W.O. Gold Supervision2026.04 | 60.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OPERA (MAPGRPO)Type=RL2025.08 | 60.2 | — | — | 72.7 | — | — | — | — | — | — | — | — | — | — | |
| DAPOBackbone=Qwen3-4B2026.06 | 60.2 | — | — | 67.7 | — | — | — | 68.1 | — | — | — | — | — | — | |
| SR-RAGBackbone=GPT-4.12025.12 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QuCo-RAGBackbone=GPT-5-chat2025.12 | 59.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FS-RAGBackbone=GPT-4.12025.12 | 59.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ProGraph-R1Base Model=Qwen2.5-7B-Instruct, Optimization Method=Training, Knowledge Interaction=Graph-based knowledge2026.01 | 59.38 | — | — | 69.75 | — | — | — | — | — | — | — | — | — | — | |
| Graph-R1Backbone=Qwen2.5-7B-Instruct, Interaction Type=Training, Knowledge Representation=Graph-based2026.05 | 58.59 | — | — | 68.18 | — | — | — | — | — | — | — | — | — | — | |
| HippoRAGMethod Type=Hybrid, Backbone LLM=deepseek-v3-03242026.01 | 57.8 | — | — | 68.4 | — | — | — | — | — | — | — | — | — | — | |
| IRCOT QA2022.12 | 57.7 | — | — | 68 | — | — | — | — | — | — | — | — | — | — | |
| CCSBackbone=Qwen2.5-7B-Instruct, Supervision Strategy=W.O. Gold Supervision2026.04 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CJBackbone=Qwen2.5-7B-Instruct, Supervision Strategy=W.O. Gold Supervision2026.04 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ProGraph-R1Base Model=Qwen2.5-3B-Instruct, Optimization Method=Training, Knowledge Interaction=Graph-based knowledge2026.01 | 55.47 | — | — | 61.72 | — | — | — | — | — | — | — | — | — | — | |
| Graph-R1Base Model=Qwen2.5-7B-Instruct, Optimization Method=Training, Knowledge Interaction=Graph-based knowledge2026.01 | 55.47 | — | — | 65.04 | — | — | — | — | — | — | — | — | — | — | |
| RLIFBackbone=Qwen3-32B, Supervision Strategy=W.O. Gold Supervision2026.04 | 55.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Wo-RAGBackbone=GPT-4.12025.12 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FABLE(docs)selection_strategy=LLM-guided, bi_path_fusion=true, retrieval_unit=documents2026.01 | 52.5 | — | — | 63.87 | — | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-Procategory=LLM-in-context, mode=Full-context Inference2026.01 | 52.02 | — | — | 63.68 | — | — | — | — | — | — | — | — | — | — | |
| RLIFBackbone=Qwen3-4B-Instruct-2507, Supervision Strategy=W.O. Gold Supervision2026.04 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SR-RAGBackbone=GPT-5-chat2025.12 | 51 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIGRAG2026.06 | 50.9 | — | — | 58.6 | — | — | — | — | — | — | — | — | — | — | |
| HippoRAG22026.06 | 50.2 | — | — | 55.57 | — | — | — | — | — | — | — | — | — | — | |
| Wo-RAGBackbone=GPT-5-chat2025.12 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IQATRLLM Backbone=Llama-3.1-8B, Retriever=Contriever, Retriever Fine-tuning=ReSCORE2025.05 | 50 | — | — | 59.7 | — | — | — | — | — | — | — | — | — | — | |
| FABLE(nodes)selection_strategy=LLM-guided, bi_path_fusion=true, retrieval_unit=nodes2026.01 | 50 | — | — | 60.26 | — | — | — | — | — | — | — | — | — | — | |
| Graph-R1Base Model=Qwen2.5-3B-Instruct, Optimization Method=Training, Knowledge Interaction=Graph-based knowledge2026.01 | 50 | — | — | 57.56 | — | — | — | — | — | — | — | — | — | — | |
| QuCo-RAGBackbone=Qwen2.5-32B2025.12 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FLAREBackbone=GPT-4.12025.12 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IRCOTLLM Backbone=Flan-T5-XL, Retriever=BM252025.05 | 49.7 | — | — | 54.9 | — | — | — | — | — | — | — | — | — | — | |
| CJBackbone=Qwen3-4B-Instruct-2507, Supervision Strategy=W.O. Gold Supervision2026.04 | 49.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| xRAGComp. rate=x128, Retrieval status=w/ retrieval2026.01 | 48.8 | — | — | 8.66 | — | — | — | 22 | — | — | — | — | — | — | |
| TTRLBackbone=Qwen3-4B-Instruct-2507, Supervision Strategy=W.O. Gold Supervision2026.04 | 48.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Web-ToolBackbone=GPT-5-chat2025.12 | 48.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-o1Backbone=Qwen2.5-7B-Instruct, Supervision Strategy=Model Inference2026.04 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FS-RAGBackbone=GPT-5-chat2025.12 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RAPTORMethod Type=Text-based, Backbone LLM=deepseek-v3-03242026.01 | 46.7 | — | — | 54.8 | — | — | — | — | — | — | — | — | — | — | |
| LightRAG2026.06 | 45.7 | — | — | 51.17 | — | — | — | — | — | — | — | — | — | — | |
| TTRLBackbone=Qwen2.5-7B-Instruct, Supervision Strategy=W.O. Gold Supervision2026.04 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-AdaptR1Backbone=Qwen2.5-7B-Instruct, Interaction Type=Training, Knowledge Representation=Chunk-based2026.05 | 45.31 | — | — | 51.55 | — | — | — | — | — | — | — | — | — | — | |
| Llama-3.1-8B BaselineLLM Backbone=Llama-3.1-8B, Retriever=BM252025.05 | 44.6 | — | — | 52.2 | — | — | — | — | — | — | — | — | — | — | |
| QCompilerStrategy=Query Understanding, Base Model=Llama3.2-3B-Instruct, Fine-tuned=true2025.05 | 44.5 | — | — | 51.9 | — | — | — | 53.5 | — | — | — | — | — | — | |
| HippoRAG2category=Structure-Enhanced RAG2026.01 | 44.5 | — | — | 59.67 | — | — | — | — | — | — | — | — | — | — | |
| RLIFBackbone=Qwen2.5-7B-Instruct, Supervision Strategy=W.O. Gold Supervision2026.04 | 44.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NaiveRAG2026.06 | 44.4 | — | — | 48.49 | — | — | — | — | — | — | — | — | — | — | |
| BGMType=RL2025.08 | 44.3 | — | — | 55.8 | — | — | — | — | — | — | — | — | — | — | |
| IRCoTType=CoT2025.08 | 43.3 | — | — | 56.2 | — | — | — | — | — | — | — | — | — | — | |
| Adaptive-NoteLLM Backbone=GPT-3.5, Retriever=BM252025.05 | 43.2 | — | — | 54.2 | — | — | — | — | — | — | — | — | — | — | |
| Web-ToolBackbone=GPT-4.12025.12 | 42.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InForageRetrieval=Agent w/ Retrieval2026.02 | 42.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OPERA (CoT)Type=CoT2025.08 | 42.3 | — | — | 50.7 | — | — | — | — | — | — | — | — | — | — | |
| Search-R1 (PPO)Multi-turn=true, Backbone=Qwen2.5-32B-Instruct2026.02 | 41.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CriticSearchRetrieval=Agent w/ Retrieval2026.02 | 40.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adaptive-RAGLLM Backbone=Flan-T5-XL, Retriever=BM252025.05 | 40.6 | — | — | 49.8 | — | — | — | — | — | — | — | — | — | — | |
| SelfAskAuthors=Press et al., 20222022.12 | 40.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoRefine-BaseRetrieval=Agent w/ Retrieval2026.02 | 39.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-Flashcategory=LLM-in-context, mode=Full-context Inference2026.01 | 38.5 | — | — | 54.94 | — | — | — | — | — | — | — | — | — | — | |
| QuCo-RAGBackbone=Llama-3-8B2025.12 | 38.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoRefine-InstructRetrieval=Agent w/ Retrieval2026.02 | 38 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| O2-SearcherRetrieval=Agent w/ Retrieval2026.02 | 37.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoT-SC + VEknowledge=Dataset, Model=GPT-3 davinci-0032023.05 | 37.2 | — | — | — | — | 9.5 | 32.28 | — | — | — | — | — | — | — | |
| Search-R1Base Model=Qwen2.5-7B-Instruct, Optimization Method=Training, Knowledge Interaction=Chunk-based knowledge2026.01 | 36.72 | — | — | 41.29 | — | — | — | — | — | — | — | — | — | — | |
| G-RetrieverMethod Type=Graph-based, Backbone LLM=deepseek-v3-03242026.01 | 36.2 | — | — | 45.5 | — | — | — | — | — | — | — | — | — | — | |
| SE-Search-3BRetrieval=Agent w/ Retrieval2026.02 | 36.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FS-RAGBackbone=Qwen2.5-32B2025.12 | 35.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RAGBackbone=Qwen3-32B, Supervision Strategy=Model Inference2026.04 | 35.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Interaction Type=Training, Knowledge Representation=Chunk-based2026.05 | 35.15 | — | — | 38.21 | — | — | — | — | — | — | — | — | — | — | |
| Search-R1 (GRPO)Multi-turn=true, Backbone=Qwen2.5-32B-Instruct2026.02 | 34.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZeroSearch-BaseRetrieval=Agent w/ Retrieval2026.02 | 34.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Direct InferenceBackbone=Qwen3-32B, Supervision Strategy=Model Inference2026.04 | 34 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StepSearch-BaseRetrieval=Agent w/ Retrieval2026.02 | 33.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoTBackbone=Qwen3-32B, Supervision Strategy=Model Inference2026.04 | 33.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoT-SC + VEknowledge=Google, Model=GPT-3 davinci-0032023.05 | 33.6 | — | — | — | — | 5.9 | 30.06 | — | — | — | — | — | — | — | |
| SeaKRBackbone=Llama-3-8B2025.12 | 33.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Search-o1Backbone=Qwen3-4B-Instruct-2507, Supervision Strategy=Model Inference2026.04 | 33.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMLingua-2Comp. rate=x3, Retrieval status=w/ retrieval2026.01 | 33.4 | — | — | 15.78 | — | — | — | 23.2 | — | — | — | — | — | — | |
| CoT-SC + VEknowledge=Wiki., Model=GPT-3 davinci-0032023.05 | 33.1 | — | — | — | — | 5.4 | 28.32 | — | — | — | — | — | — | — | |
| RAGBackbone=Qwen2.5-7B-Instruct, Supervision Strategy=Model Inference2026.04 | 33.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama-3.1-8B BaselineLLM Backbone=Llama-3.1-8B, Retriever=Contriever2025.05 | 32.8 | — | — | 41.6 | — | — | — | — | — | — | — | — | — | — | |
| ToGMethod Type=Graph-based, Backbone LLM=deepseek-v3-03242026.01 | 32.8 | — | — | 37.3 | — | — | — | — | — | — | — | — | — | — | |
| TIR PromptingBackbone=Qwen3-4B2026.06 | 32.8 | — | — | 42.3 | — | — | — | 47.2 | — | — | — | — | — | — | |
| Raptor2026.06 | 32.4 | — | — | 38.24 | — | — | — | — | — | — | — | — | — | — |