Question Answering on Search-augmented QA tasks Average
48.3Average AccuracyHCAPO (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| HCAPO (Ours)Type=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 48.3 | |
| GiGPOType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 47.2 | |
| HCAPO (Ours)Type=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 44.3 | |
| GiGPOType=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 42.1 | |
| StepSearchType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 40 | |
| ZeroSearchType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 39.1 | |
| Search-R1Type=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 38.5 | |
| StepSearchType=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 34.4 | |
| Search-R1Type=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 32.5 | |
| ZeroSearchType=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 31.7 | |
| R1-InstructType=RL Training, Base Model=Qwen2.5-3B-Instruct2026.03 | 27.1 | |
| R1-InstructType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 22.4 |