Multi-hop Question Answering on Bamboogle (pass@1)
69.6pass@1Qwen2.5-14B-Instruct + SSP
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-14B-Instruct + SSPTraining Paradigm=Scaling to Larger Models, SSP Integration=true2025.10 | 69.6 | |
| Qwen2.5-32B-Instruct + SSPTraining Paradigm=Scaling to Larger Models, SSP Integration=true2025.10 | 69.6 | |
| Qwen3-8B + SSPTraining Paradigm=Generalization Across Model Families, SSP Integration=true2025.10 | 67.2 | |
| Qwen2.5-14B-InstructTraining Paradigm=Scaling to Larger Models, SSP Integration=false2025.10 | 64.8 | |
| Qwen2.5-32B-InstructTraining Paradigm=Scaling to Larger Models, SSP Integration=false2025.10 | 63.2 | |
| Search-R1-7B + SSPTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=true2025.10 | 59.2 | |
| Qwen3-8BTraining Paradigm=Generalization Across Model Families, SSP Integration=false2025.10 | 58.4 | |
| Search-R1-7BTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=false2025.10 | 55.2 | |
| R-Search-7B + SSPTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=true2025.10 | 55.2 | |
| Qwen2.5-7B-Instruct + SSPTraining Paradigm=From-Scratch Training on Base and Instruct Models, SSP Integration=true2025.10 | 54.4 | |
| R-Search-7BTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=false2025.10 | 53.6 | |
| Qwen2.5-7B-InstructTraining Paradigm=From-Scratch Training on Base and Instruct Models, SSP Integration=false2025.10 | 51.2 | |
| Qwen2.5-7B-Base + SSPTraining Paradigm=From-Scratch Training on Base and Instruct Models, SSP Integration=true2025.10 | 47.2 | |
| ZeroSearch-7B + SSPTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=true2025.10 | 44 | |
| ZeroSearch-7BTraining Paradigm=Continual Training on Search-Specialized Agents, SSP Integration=false2025.10 | 40.8 | |
| LLaMA-3.1-8B + SSPTraining Paradigm=Generalization Across Model Families, SSP Integration=true2025.10 | 40 | |
| LLaMA-3.1-8BTraining Paradigm=Generalization Across Model Families, SSP Integration=false2025.10 | 30.4 | |
| Qwen2.5-7B-BaseTraining Paradigm=From-Scratch Training on Base and Instruct Models, SSP Integration=false2025.10 | 26.4 |