Single-Hop Question Answering on NQ (test)
48.9AccuracyGRPO w/ PaW
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 48.9 | |
| STAPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 48.8 | |
| GRPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 47.9 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 46.5 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct, Type=Process RL2026.07 | 46.4 | |
| GIGPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 46.2 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 46.1 | |
| GRPO w/ PaWType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 45.8 | |
| GRPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 44.9 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 43.6 | |
| ZeroSearchBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 43.6 | |
| STAPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 43.1 | |
| GIGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 42.5 | |
| GiGPOBackbone=Qwen2.5-3B-Instruct, Type=Process RL2026.07 | 42 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 41.4 | |
| ZeroSearchBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 41.4 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.06 | 39.3 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 39.3 | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.06 | 34.1 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 34.1 | |
| R1-InstructBackbone=Qwen2.5-7B-Instruct, Type=Outcome RL2026.07 | 27 | |
| R1-InstructBackbone=Qwen2.5-3B-Instruct, Type=Outcome RL2026.07 | 21 |