Multi-Hop Question Answering on HotpotQA, 2Wiki, Musique, and Bamboogle (test)
57.02HotpotQA ScoreJADE
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| JADEBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Joint Agentic Dynamic Execution2026.01 | 57.02 | 53.87 | 29.26 | 58.26 | 49.6 | 53.86 | — | — | |
| MMOA-RAGBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=RL-Based (Static Modular Workflow)2026.01 | 49.21 | 41.66 | 17.26 | 37.2 | 36.33 | 45.57 | — | — | |
| AKBE (Ours)Backbone Model=Qwen2.5-7B2026.05 | 48.69 | 47.59 | 22.23 | 48.8 | 45.24 | — | 2.94 | 15.39 | |
| β-GRPOBackbone Model=Qwen2.5-7B2026.05 | 48.02 | 47.92 | 21.6 | 48 | 45.13 | — | 3.34 | 13.51 | |
| Offline AKBEBackbone Model=Qwen2.5-7B2026.05 | 47.38 | 46.81 | 20.95 | 46.4 | 44.22 | — | 2.68 | 16.5 | |
| R1-SearcherBackbone Model=Qwen2.5-7B2026.05 | 47.21 | — | 20.63 | 44 | 43.02 | — | 3.91 | 11 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Agentic Search (Adaptive Workflow)2026.01 | 46.87 | 39.03 | 17.97 | 38.69 | 35.64 | 43.91 | — | — | |
| BGMBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=RL-Based (Static Modular Workflow)2026.01 | 46.85 | 37.79 | 17.55 | 37.38 | 34.89 | 44.18 | — | — | |
| MAO-ARAGBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Agentic Search (Adaptive Workflow)2026.01 | 46.65 | 43.96 | 22.38 | 49.84 | 40.71 | 41.22 | — | — | |
| Search-R1Backbone Model=Qwen2.5-7B2026.05 | 46.64 | 45.6 | 19.97 | 45.9 | 43.19 | — | 3.77 | 11.45 | |
| AKBE (Ours)Backbone Model=Qwen3-4B2026.05 | 46.53 | 51.89 | 21.17 | 56.8 | 46.82 | — | 2.6 | 18.01 | |
| RRRBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=RL-Based (Static Modular Workflow)2026.01 | 46.21 | 41.52 | 18.27 | 36.59 | 35.65 | 44.72 | — | — | |
| β-GRPOBackbone Model=Qwen3-4B2026.05 | 45.83 | 51.49 | 21.06 | 56 | 46.39 | — | 3.01 | 15.41 | |
| R1-SearcherBackbone Model=Qwen3-4B2026.05 | 45.62 | 49.83 | 19.51 | 50.4 | 45.2 | — | 3.28 | 13.78 | |
| Offline AKBEBackbone Model=Qwen3-4B2026.05 | 45.21 | 51.12 | 19.84 | 54.4 | 45.84 | — | 2.45 | 18.71 | |
| Search-R1Backbone Model=Qwen3-4B2026.05 | 44.8 | 50.66 | 18.94 | 52 | 45.4 | — | 3.16 | 14.33 | |
| Adaptive RAGBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Agentic Search (Adaptive Workflow)2026.01 | 42.38 | 39.62 | 25.48 | 34.85 | 35.58 | 37.11 | — | — | |
| OTC-POBackbone Model=Qwen2.5-7B2026.05 | 42.16 | 43.72 | 20.48 | 44.8 | 40.72 | — | 1.56 | 26.1 | |
| TRACEBackbone=Llama-3.2-3B2026.06 | 41 | 35.3 | 15.2 | 37.7 | 32.3 | — | — | — | |
| TreePOBackbone=Llama-3.2-3B2026.06 | 39.7 | 33.6 | 13.6 | 29.9 | 29.2 | — | — | — | |
| PCLBackbone=Llama-3.2-3B2026.06 | 39.3 | 32.5 | 13.4 | 30.5 | 28.9 | — | — | — | |
| OTC-POBackbone Model=Qwen3-4B2026.05 | 38.74 | 47.71 | 15.16 | 48 | 41.27 | — | 2.06 | 20.03 | |
| GRPOBackbone=Llama-3.2-3B2026.06 | 38.2 | 30.5 | 13 | 32.3 | 28.5 | — | — | — | |
| Search-o1Backbone Model=Qwen3-4B2026.05 | 35.18 | 38.45 | 14.21 | 48 | 34.83 | — | 3.31 | 10.52 | |
| ReActBackbone Model=Qwen3-4B2026.05 | 30.42 | 32.92 | 12.83 | 44.8 | 30.01 | — | 3.43 | 8.75 | |
| Vanilla RAGBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Standard Baseline, RAG Configuration=Simple RAG2026.01 | 28.33 | 25.91 | 25.2 | 25.28 | 26.18 | 34.89 | — | — | |
| Search-o1Backbone Model=Qwen2.5-7B2026.05 | 18.52 | 16.73 | 5.42 | 16 | 16.1 | — | 3.92 | 4.11 | |
| LLM w/o RAGBackbone=Qwen2.5-7B-Instruct, Workflow Paradigm=Standard Baseline, RAG Configuration=None2026.01 | 17.76 | 22.58 | 8.58 | 17.14 | 16.52 | 17.44 | — | — | |
| ReActBackbone=Llama-3.2-3B2026.06 | 6.7 | 7.3 | 2.9 | 6.6 | 5.9 | — | — | — | |
| ReActBackbone Model=Qwen2.5-7B2026.05 | 2.85 | 1.94 | 0.58 | 4 | 2.1 | — | 4.04 | 0.52 | |
| LLDSBackbone=Qwen2.5-3b-Instruct, Base Training=Search-R1-GSPO2025.12 | 0.466 | 0.456 | 0.215 | 0.403 | 0.385 | 0.451 | — | — | |
| LLDS-MABackbone=Qwen2.5-3b-Base, Base Training=Search-R1-GRPO2025.12 | 0.452 | 0.443 | 0.197 | 0.395 | 0.372 | 0.44 | — | — | |
| LLDSBackbone=Qwen2.5-3b-Instruct, Base Training=Search-R1-GRPO2025.12 | 0.443 | 0.447 | 0.197 | 0.444 | 0.383 | 0.441 | — | — | |
| Tree-GRPOBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.424 | 0.437 | 0.178 | 0.432 | 0.368 | 0.424 | — | — | |
| CriticSearchBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.414 | 0.409 | 0.18 | 0.368 | 0.343 | — | — | — | |
| DARTBackbone=Qwen2.5-3b-Base2026.02 | 0.399 | 0.389 | 0.155 | 0.352 | 0.324 | — | — | — | |
| DARTBackbone=Qwen2.5-3b-Instruct2026.02 | 0.392 | 0.376 | 0.143 | 0.352 | 0.316 | — | — | — | |
| LLDSBackbone=Qwen2.5-3b-Base, Base Training=Search-R1-GRPO2025.12 | 0.345 | 0.323 | 0.082 | 0.21 | 0.24 | 0.36 | — | — | |
| ZeroSearch-BaseBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.338 | 0.346 | 0.13 | 0.139 | 0.238 | 0.345 | — | — | |
| Search-R1-GSPOBackbone=Qwen2.5-3b-Instruct2025.12 | 0.332 | 0.329 | 0.098 | 0.25 | 0.252 | 0.331 | — | — | |
| Search-R1-GRPOBackbone=Qwen2.5-3b-Instruct2026.02 | 0.331 | 0.31 | 0.124 | 0.232 | 0.249 | — | — | — | |
| Search-R1-GRPOBackbone=Qwen2.5-3b-Instruct2025.12 | 0.331 | 0.31 | 0.124 | 0.232 | 0.249 | 0.336 | — | — | |
| Search-R1-PPO-InsBackbone=Qwen2.5-3b-Instruct2026.02 | 0.324 | 0.319 | 0.103 | 0.264 | 0.253 | — | — | — | |
| Search-R1-PPO-InsBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.324 | 0.319 | 0.103 | 0.264 | 0.253 | 0.325 | — | — | |
| Search-R1-GRPOBackbone=Qwen2.5-3b-Base2025.12 | 0.297 | 0.274 | 0.066 | 0.128 | 0.191 | 0.312 | — | — | |
| StepSearchBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.294 | 0.36 | 0.14 | 0.258 | 0.263 | 0.311 | — | — | |
| Search-R1-PPO-BaseBackbone=Qwen2.5-3b-Base2026.02 | 0.284 | 0.273 | 0.049 | 0.088 | 0.174 | — | — | — | |
| Search-R1-PPO-BaseBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.284 | 0.273 | 0.049 | 0.088 | 0.174 | 0.303 | — | — | |
| ZeroSearch-InsBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.274 | 0.3 | 0.098 | 0.111 | 0.196 | 0.317 | — | — | |
| Search-R1-GRPOBackbone=Qwen2.5-3b-Base2026.02 | 0.265 | 0.244 | 0.061 | 0.113 | 0.171 | — | — | — | |
| RAGBackbone=Qwen2.5-3B2026.02 | 0.255 | 0.226 | 0.047 | 0.08 | 0.152 | — | — | — | |
| RAGBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.255 | 0.226 | 0.047 | 0.08 | 0.152 | 0.27 | — | — | |
| Rejection SamplingBackbone=Qwen2.5-3B2026.02 | 0.24 | 0.233 | 0.059 | 0.21 | 0.186 | — | — | — | |
| Rejection SamplingBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.24 | 0.233 | 0.059 | 0.21 | 0.186 | 0.265 | — | — | |
| Search-o1Backbone=Qwen2.5-3B2026.02 | 0.221 | 0.218 | 0.054 | 0.32 | 0.203 | — | — | — | |
| Search-o1Backbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.221 | 0.218 | 0.054 | 0.32 | 0.203 | 0.255 | — | — | |
| R1-instructBackbone=Qwen2.5-3b-Instruct2026.02 | 0.208 | 0.275 | 0.06 | 0.192 | 0.184 | — | — | — | |
| R1-instructBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.208 | 0.275 | 0.06 | 0.192 | 0.184 | 0.224 | — | — | |
| R1-baseBackbone=Qwen2.5-3b-Base2026.02 | 0.201 | 0.268 | 0.055 | 0.224 | 0.187 | — | — | — | |
| R1-baseBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.201 | 0.268 | 0.055 | 0.224 | 0.187 | 0.229 | — | — | |
| SFTBackbone=Qwen2.5-3B2026.02 | 0.186 | 0.248 | 0.044 | 0.112 | 0.147 | — | — | — | |
| IRCoTBackbone=Qwen2.5-3B2026.02 | 0.164 | 0.171 | 0.067 | 0.24 | 0.161 | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-3B2026.02 | 0.149 | 0.244 | 0.02 | 0.024 | 0.109 | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-3b-Base/Instruct2025.12 | 0.149 | 0.244 | 0.02 | 0.024 | 0.109 | 0.134 | — | — | |
| CoTBackbone=Qwen2.5-3B2026.02 | 0.021 | 0.021 | 0.002 | 0 | 0.011 | — | — | — |