Multi-Hop Question Answering on 2Wiki (test) using Accuracy (%)
45.1AccuracyGRPO w/ PaW
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 45.1 | |
| STAPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 45 | |
| GRPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 43.6 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 43.6 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 42.8 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 41.2 | |
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 40.1 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 40.1 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 40.1 | |
| GRPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 39.5 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 38 | |
| GiGPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 37 | |
| StepSearchBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 36.6 | |
| STAPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 36.4 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 35.2 | |
| ZeroSearchBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 35.2 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 34.4 | |
| StepSearchBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 32 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 31.9 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 31.9 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 30 | |
| ZeroSearchBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 30 | |
| R1-InstructBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 29.2 | |
| R1-InstructBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 27.5 |