Multi-Hop Question Answering on HotpotQA (in-domain) (Accuracy)
45.1AccuracyGEPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GEPOType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 45.1 | |
| SKILLRLBackbone=Qwen2.5-7B-Instruct2026.02 | 43.2 | |
| GiGPOType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 41.6 | |
| GEPOType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 40.6 | |
| StepSearchBackbone=Qwen2.5-7B-Instruct2026.02 | 38.6 | |
| StepSearchType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 38.6 | |
| EvolveRBackbone=Qwen2.5-7B-Instruct2026.02 | 38.2 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct2026.02 | 37 | |
| Search-R1Type=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 37 | |
| GiGPOType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 36.9 | |
| ZeroSearchBackbone=Qwen2.5-7B-Instruct2026.02 | 34.6 | |
| ZeroSearchType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 34.6 | |
| StepSearchType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 34.5 | |
| Search-R1Type=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 32.4 | |
| ZeroSearchType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 27.4 | |
| RAGBackbone=Qwen2.5-7B-Instruct2026.02 | 25.8 | |
| R1-InstructType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 23.7 | |
| R1-InstructBackbone=Qwen2.5-7B-Instruct2026.02 | 20.8 | |
| R1-InstructType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 20.8 | |
| Search-o1Backbone=Qwen2.5-7B-Instruct2026.02 | 17 | |
| Qwen2.5Backbone=Qwen2.5-7B-Instruct2026.02 | 16.4 | |
| CoTBackbone=Qwen2.5-7B-Instruct2026.02 | 16.2 |