Multi-Hop Search-augmented Question Answering on MuSiQue (success rate %)
17.8Success RateRole-Agent
Evaluation Results
| Method | Links | |
|---|---|---|
| Role-AgentType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 17.8 | |
| StepSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 17.4 | |
| GiGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 12.6 | |
| + MASABackbone=Qwen3-32B2026.05 | 11.8 | |
| + Base SkillBackbone=Qwen3-32B2026.05 | 11.7 | |
| + DS-AdapterBackbone=Qwen3-32B2026.05 | 11.6 | |
| + Base SkillBackbone=Qwen3-14B2026.05 | 11.4 | |
| Search_R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 10.3 | |
| + MASABackbone=Qwen3-8B2026.05 | 10 | |
| Zero-SearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 9.8 | |
| + MASABackbone=Qwen3-14B2026.05 | 9.7 | |
| + MASABackbone=Qwen3-4B2026.05 | 9.4 | |
| + DS-AdapterBackbone=Qwen3-4B2026.05 | 9.3 | |
| + DS-AdapterBackbone=Qwen3-14B2026.05 | 9.2 | |
| No SkillBackbone=Qwen3-32B2026.05 | 8.6 | |
| + Base SkillBackbone=Qwen3-4B2026.05 | 7.8 | |
| No SkillBackbone=Qwen3-14B2026.05 | 7.6 | |
| R1-InstructType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 7.2 | |
| No SkillBackbone=Qwen3-8B2026.05 | 6.7 | |
| No SkillBackbone=Qwen3-4B2026.05 | 6.4 | |
| + Base SkillBackbone=Qwen3-8B2026.05 | 6.2 | |
| + DS-AdapterBackbone=Qwen3-8B2026.05 | 5.6 |