Single-Hop Search-augmented Question Answering on PopQA
49.8Success RateRole-Agent
Evaluation Results
| Method | Links | |
|---|---|---|
| Role-AgentType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 49.8 | |
| Zero-SearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 44.8 | |
| GiGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 42.4 | |
| + DS-AdapterBackbone=Qwen3-4B2026.05 | 41.8 | |
| + MASABackbone=Qwen3-14B2026.05 | 40.7 | |
| No SkillBackbone=Qwen3-14B2026.05 | 40.6 | |
| + DS-AdapterBackbone=Qwen3-32B2026.05 | 40.6 | |
| + MASABackbone=Qwen3-32B2026.05 | 40 | |
| + Base SkillBackbone=Qwen3-14B2026.05 | 39.5 | |
| + DS-AdapterBackbone=Qwen3-14B2026.05 | 39.5 | |
| + Base SkillBackbone=Qwen3-32B2026.05 | 39.3 | |
| + MASABackbone=Qwen3-8B2026.05 | 39 | |
| + MASABackbone=Qwen3-4B2026.05 | 38.9 | |
| + Base SkillBackbone=Qwen3-8B2026.05 | 38.8 | |
| + DS-AdapterBackbone=Qwen3-8B2026.05 | 38.7 | |
| No SkillBackbone=Qwen3-32B2026.05 | 38.3 | |
| + Base SkillBackbone=Qwen3-4B2026.05 | 38.2 | |
| Search_R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 37.8 | |
| No SkillBackbone=Qwen3-4B2026.05 | 37.2 | |
| No SkillBackbone=Qwen3-8B2026.05 | 30.3 | |
| R1-InstructType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 19.9 |