Accuracy on Multi-Hop Question Answering on Bamboogle (test)
70.1AccuracyGRPO w/ PaW
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 70.1 | |
| GRPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 69.6 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 69.5 | |
| STAPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 69.4 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 68.9 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 68.9 | |
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 65.2 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 64.9 | |
| STAPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 64.9 | |
| GRPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 64.1 | |
| GiGPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 64.1 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 60 | |
| StepSearchBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 40 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 36.8 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 36.8 | |
| StepSearchBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 34.4 | |
| R1-InstructBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 29.3 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 27.8 | |
| ZeroSearchBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 27.8 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 26.4 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 26.4 | |
| R1-InstructBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 19.2 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 11.1 | |
| ZeroSearchBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 11.1 |