Multi-hop Question Answering on 2WikiMQA
76.4F1 ScoreCIRAG
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| CIRAGBase LLM=Qwen2.5-max2026.01 | 76.4 | — | — | — | — | — | 67.1 | — | — | |
| BranPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 75.6 | — | — | — | — | 85.4 | — | — | — | |
| DualRAGBase LLM=Qwen2.5-max2026.01 | 75.6 | — | — | — | — | — | 65.8 | — | — | |
| RT-RAGModels=GPT-4o-mini2026.01 | 75.08 | — | — | — | — | — | 63 | — | — | |
| SPARC-RAGBackbone=Qwen3-32B2026.01 | 74.1 | 78.4 | — | 71.2 | — | — | 61.2 | — | — | |
| CARLModel=4B Reasoning, Max actions=322025.12 | 74 | — | — | — | — | 77.3 | — | — | — | |
| RT-RAGModels=Qwen2.5-14B2026.01 | 73.69 | — | — | — | — | — | 64 | — | — | |
| CheckRLMBackbone=QwQ-32B2026.07 | 73.4 | — | — | — | — | — | 62 | — | — | |
| BranPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 72 | — | — | — | — | 80.2 | — | — | — | |
| GRPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 71.9 | — | — | — | — | 82.6 | — | — | — | |
| GraphAnchorBackbone=Qwen3-32B2026.01 | 71.59 | — | — | — | — | — | 60.5 | — | — | |
| Search-o1Backbone=QwQ-32B2026.07 | 71.4 | — | — | — | — | — | 60.4 | — | — | |
| GRPOModel=4B Reasoning, Max actions=322025.12 | 71.1 | — | — | — | — | 73.5 | — | — | — | |
| GRPOModel=4B Reasoning, Max actions=102025.12 | 70.9 | — | — | — | — | 73.4 | — | — | — | |
| CheckRLMBackbone=Qwen3-32B2026.07 | 70.8 | — | — | — | — | — | 60.8 | — | — | |
| CARLModel=4B Reasoning, Max actions=102025.12 | 70.6 | — | — | — | — | 72.2 | — | — | — | |
| TreeRPOModel=4B Reasoning, Max actions=102025.12 | 70.1 | — | — | — | — | 72.6 | — | — | — | |
| SPARC-RAG + DPOBackbone=Qwen3-32B, fine-tuned=true2026.01 | 69.8 | 75.2 | — | 67.5 | — | — | 57.6 | — | — | |
| CheckRLMBackbone=Qwen3-8B2026.07 | 69.7 | — | — | — | — | — | 58.6 | — | — | |
| CIRAGBase LLM=Qwen2.5-7B2026.01 | 69.5 | — | — | — | — | — | 59 | — | — | |
| TreeRLModel=4B Reasoning, Max actions=102025.12 | 69.5 | — | — | — | — | 71.5 | — | — | — | |
| BranPOBackbone=Qwen3-4B-Instruct-25072026.02 | 69.4 | — | — | — | — | 78.4 | — | — | — | |
| CARL-LiteModel=4B Reasoning, Max actions=102025.12 | 69.1 | — | — | — | — | 71.8 | — | — | — | |
| Tree-GRPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 68.7 | — | — | — | — | 78.2 | — | — | — | |
| ARPOModel=4B Reasoning, Max actions=102025.12 | 68.7 | — | — | — | — | 70.4 | — | — | — | |
| BranPOBackbone=Qwen2.5-7B-Instruct2026.02 | 67.7 | — | — | — | — | 76 | — | — | — | |
| Tree-GRPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 67.6 | — | — | — | — | 75.1 | — | — | — | |
| Tree-GRPOBackbone=Qwen3-4B-Instruct-25072026.02 | 66.9 | — | — | — | — | 76.8 | — | — | — | |
| IRCOTBase LLM=Qwen2.5-max2026.01 | 65.7 | — | — | — | — | — | 55.3 | — | — | |
| DualRAG-FTBase LLM=Qwen2.5-7B2026.01 | 65.6 | — | — | — | — | — | 53.8 | — | — | |
| GraphAnchorBackbone=Qwen2.5-14B-Instruct2026.01 | 64.83 | — | — | — | — | — | 55.21 | — | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 64.8 | — | — | — | — | 73.6 | — | — | — | |
| DeepNoteBackbone=Qwen3-32B2026.01 | 64.4 | 69.2 | — | 61.4 | — | — | 50.6 | — | — | |
| GRPOBackbone=Qwen3-4B-Instruct-25072026.02 | 64.2 | — | — | — | — | 75.1 | — | — | — | |
| Tree-GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 63.9 | — | — | — | — | 71.8 | — | — | — | |
| SFTBackbone=Qwen3-4B-Instruct-25072026.02 | 63.7 | — | — | — | — | 73.3 | — | — | — | |
| GiGPOBackbone=Qwen3-4B-Instruct-25072026.02 | 63.3 | — | — | — | — | 72.8 | — | — | — | |
| GraphAnchorBackbone=Llama3.1-8B-Instruct2026.01 | 62.93 | — | — | — | — | — | 55.14 | — | — | |
| ChainRAG (AnsInt)Models=GPT-4o-mini2026.01 | 62.55 | — | — | — | — | — | 52 | — | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 62.4 | — | — | — | — | 71.8 | — | — | — | |
| LongRAGModels=GPT-4o-mini2026.01 | 62.39 | — | — | — | — | — | 49 | — | — | |
| HippoRAG w/ IRCoTModels=GPT-4o-mini2026.01 | 62.38 | — | — | — | — | — | 48 | — | — | |
| DualRAGBase LLM=Qwen2.5-7B2026.01 | 62.3 | — | — | — | — | — | 51.7 | — | — | |
| GraphAnchorBackbone=Qwen2.5-7B-Instruct2026.01 | 61.64 | — | — | — | — | — | 52.2 | — | — | |
| SPARC-RAG + DPOBackbone=Qwen2.5-7B-Instruct, fine-tuned=true2026.01 | 61.2 | 63 | — | 57.5 | — | — | 48.4 | — | — | |
| LongRAGModels=Qwen2.5-14B2026.01 | 60.49 | — | — | — | — | — | 50 | — | — | |
| KiRAGBase LLM=Qwen2.5-max2026.01 | 59.4 | — | — | — | — | — | 52.1 | — | — | |
| MetaRAGBase LLM=Qwen2.5-max2026.01 | 58.7 | — | — | — | — | — | 52.4 | — | — | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.02 | 58.6 | — | — | — | — | 67.1 | — | — | — | |
| ItER-RETGENModels=GPT-4o-mini2026.01 | 58.43 | — | — | — | — | — | 50.5 | — | — | |
| IRCoTModels=GPT-4o-mini2026.01 | 57.81 | — | — | — | — | — | 46 | — | — | |
| NaiveRAG w/ QDModels=GPT-4o-mini2026.01 | 56.88 | — | — | — | — | — | 38.5 | — | — | |
| DeepNoteBackbone=Llama3.1-8B-Instruct2026.01 | 56.65 | — | — | — | — | — | 45.8 | — | — | |
| ChainRAG (CxtInt)Models=GPT-4o-mini2026.01 | 56.54 | — | — | — | — | — | 50.5 | — | — | |
| RAMBackbone=Qwen3-4B-Instruct, Compression=4x2026.02 | 56.47 | — | — | — | — | — | 50.39 | — | — | |
| SPARC-RAGBackbone=Qwen2.5-7B-Instruct2026.01 | 56.2 | 56.2 | — | 52.5 | — | — | 45.2 | — | — | |
| MergeRAG-Asym2026.03 | 56 | 61 | — | — | — | — | 44 | — | — | |
| Self-RAGBackbone=Qwen3-32B2026.01 | 55.3 | 55.8 | — | 52.4 | — | — | 46.2 | — | — | |
| ItER-RETGENModels=Qwen2.5-14B2026.01 | 55.16 | — | — | — | — | — | 45.5 | — | — | |
| HippoRAG w/ IRCoTModels=Qwen2.5-14B2026.01 | 55.01 | — | — | — | — | — | 44 | — | — | |
| RAMBackbone=LLaMA-3.1-8B-Instruct, Compression=4x2026.02 | 54.89 | — | — | — | — | — | 48.66 | — | — | |
| Iter-RetGenBackbone=Qwen3-32B2026.01 | 54.7 | 53.8 | — | 50.2 | — | — | 42.2 | — | — | |
| CARLModel=7B Non-Reasoning, Max actions=322025.12 | 54.5 | — | — | — | — | 57.6 | — | — | — | |
| DeepNoteBackbone=Qwen2.5-7B-Instruct2026.01 | 53.72 | — | — | — | — | — | 43.4 | — | — | |
| AmberRetrieval Strategy=Amber, Backbone=Qwen2-7b2025.02 | 52.73 | 56 | — | — | — | — | — | — | — | |
| KiRAGBase LLM=Qwen2.5-7B2026.01 | 52.7 | — | — | — | — | — | 36.9 | — | — | |
| MergeRAG-Sym2026.03 | 52.3 | 55.5 | — | — | — | — | 41.5 | — | — | |
| NaiveRAGModels=Qwen2.5-14B2026.01 | 52.11 | — | — | — | — | — | 43.5 | — | — | |
| Self-AskModels=GPT-4o-mini2026.01 | 52.1 | — | — | — | — | — | 40.5 | — | — | |
| DeepNoteBackbone=Qwen2.5-7B-Instruct2026.01 | 51.4 | 50 | — | 47.7 | — | — | 41.8 | — | — | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 51.3 | — | — | — | — | 61.6 | — | — | — | |
| NaiveRAGModels=GPT-4o-mini2026.01 | 50.61 | — | — | — | — | — | 42.5 | — | — | |
| Self-AskModels=Qwen2.5-14B2026.01 | 50.53 | — | — | — | — | — | 39.5 | — | — | |
| MetaRAGBase LLM=Qwen2.5-7B2026.01 | 50.4 | — | — | — | — | — | 44.7 | — | — | |
| Adaptive-RAGRetrieval Strategy=Adaptive RAG, Backbone=Llama3-8b2025.02 | 49.75 | 46.4 | — | — | — | — | — | — | — | |
| IRCoTBackbone=Llama3.1-8B-Instruct2026.01 | 49.67 | — | — | — | — | — | 39.2 | — | — | |
| Search-R1Backbone=Qwen2.5-7B-Instruct2026.01 | 49.55 | — | — | — | — | — | 40.6 | — | — | |
| GRPOModel=7B Non-Reasoning, Max actions=322025.12 | 49.2 | — | — | — | — | 51.9 | — | — | — | |
| ProvenceBackbone=Qwen3-4B-Instruct, Compression=4x2026.02 | 48.32 | — | — | — | — | — | 39.52 | — | — | |
| RATBackbone=QwQ-32B2026.07 | 47.2 | — | — | — | — | — | 38.6 | — | — | |
| NativeRAGBase LLM=Qwen2.5-max2026.01 | 47.1 | — | — | — | — | — | 39.2 | — | — | |
| FLAREBackbone=QwQ-32B2026.07 | 46.6 | — | — | — | — | — | 38.4 | — | — | |
| NaiveRAG w/ QDModels=Qwen2.5-14B2026.01 | 46.46 | — | — | — | — | — | 40.5 | — | — | |
| Vanilla RAGBackbone=QwQ-32B2026.07 | 46.4 | — | — | — | — | — | 42.6 | — | — | |
| IRCoTModels=Qwen2.5-14B2026.01 | 46.36 | — | — | — | — | — | 36.5 | — | — | |
| AmberRetrieval Strategy=Amber, Backbone=GPT-3.52025.02 | 45.95 | 46.7 | — | — | — | — | — | — | — | |
| ReActBackbone=QwQ-32B2026.07 | 45.9 | — | — | — | — | — | 33 | — | — | |
| ProvenceBackbone=LLaMA-3.1-8B-Instruct, Compression=4x2026.02 | 45.87 | — | — | — | — | — | 30.25 | — | — | |
| SuReModels=GPT-4o-mini2026.01 | 45.8 | — | — | — | — | — | 36 | — | — | |
| IRCOTBase LLM=Qwen2.5-7B2026.01 | 45.7 | — | — | — | — | — | 36.4 | — | — | |
| RAMBackbone=Qwen3-4B-Instruct, Compression=8x2026.02 | 45.66 | — | — | — | — | — | 40.24 | — | — | |
| RAMBackbone=LLaMA-3.1-8B-Instruct, Compression=8x2026.02 | 45.24 | — | — | — | — | — | 39.63 | — | — | |
| RAPTOR2026.03 | 45.2 | 45.2 | — | — | — | — | 36.2 | — | — | |
| EXITBackbone=Qwen3-4B-Instruct, Compression=4x2026.02 | 45.04 | — | — | — | — | — | 37.06 | — | — | |
| ProvenceBackbone=Qwen3-4B-Instruct, Compression=8x2026.02 | 44.72 | — | — | — | — | — | 37.25 | — | — | |
| Vanilla RAGBackbone=Qwen3-32B2026.01 | 44.69 | — | — | — | — | — | 37.8 | — | — | |
| Vanilla RAGBackbone=Qwen3-32B2026.07 | 44.5 | — | — | — | — | — | 41.8 | — | — | |
| Activation BeaconBackbone=LLaMA-3.1-8B-Instruct, Compression=4x2026.02 | 44.2 | — | — | — | — | — | 36.69 | — | — | |
| Vanilla RAGBackbone=Qwen2.5-14B-Instruct2026.01 | 43.74 | — | — | — | — | — | 38.2 | — | — | |
| Original PromptBackbone=Qwen3-4B-Instruct2026.02 | 43.6 | — | — | — | — | — | 32.94 | — | — |