Single-Hop Search-augmented Question Answering on NQ (success rate (%))
42Success RateGiGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GiGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 42 | |
| Zero-SearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 41.4 | |
| Role-AgentType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 40.1 | |
| + MASABackbone=Qwen3-32B2026.05 | 37 | |
| + MASABackbone=Qwen3-8B2026.05 | 36.4 | |
| + MASABackbone=Qwen3-14B2026.05 | 35.6 | |
| + MASABackbone=Qwen3-4B2026.05 | 35.5 | |
| + Base SkillBackbone=Qwen3-14B2026.05 | 35.3 | |
| + Base SkillBackbone=Qwen3-4B2026.05 | 34.5 | |
| + DS-AdapterBackbone=Qwen3-32B2026.05 | 34.4 | |
| Search_R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 34.1 | |
| + Base SkillBackbone=Qwen3-8B2026.05 | 34 | |
| + DS-AdapterBackbone=Qwen3-14B2026.05 | 33.9 | |
| No SkillBackbone=Qwen3-14B2026.05 | 33.8 | |
| + Base SkillBackbone=Qwen3-32B2026.05 | 33.8 | |
| + DS-AdapterBackbone=Qwen3-8B2026.05 | 33.2 | |
| + DS-AdapterBackbone=Qwen3-4B2026.05 | 33 | |
| No SkillBackbone=Qwen3-4B2026.05 | 29.4 | |
| No SkillBackbone=Qwen3-32B2026.05 | 29.1 | |
| R1-InstructType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 27 | |
| No SkillBackbone=Qwen3-8B2026.05 | 19.1 |