Question Answering on DeepResearch
44.7HotpotQA ScoreRewardFlow
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| RewardFlowType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 44.7 | 47.4 | 65.2 | 48.1 | 47.1 | 19.9 | 71.4 | 49.1 | |
| GiGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 41.6 | 46.4 | 64.7 | 46.1 | 43.6 | 18.9 | 68.9 | 47.2 | |
| RewardFlowType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 40.3 | 44.4 | 60.9 | 44.1 | 41.2 | 15.2 | 63.7 | 44.3 | |
| StepSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 38.6 | — | — | — | 36.6 | 22.6 | 40 | — | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 37 | 39.3 | 61 | 39.7 | 40.1 | 14.6 | 36.8 | 38.5 | |
| GiGPOType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 36.9 | 42 | 59.5 | 42.4 | 37 | 12.6 | 64.1 | 42.1 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 34.6 | 43.6 | 61.8 | 51.5 | 35.2 | 18.4 | 27.8 | 39.1 | |
| StepSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 34.5 | — | — | — | 32 | 17.4 | 34.4 | — | |
| Search-R1Type=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 32.4 | 34.1 | 54.5 | 37.8 | 31.9 | 10.3 | 26.4 | 32.5 | |
| ZeroSearchType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 27.4 | 41.4 | 57.4 | 44.8 | 30 | 9.8 | 11.1 | 31.7 | |
| R1-InstructType=RL Training, Backbone=Qwen2.5-3B-Instruct2026.03 | 23.7 | 27 | 53.7 | 19.9 | 29.2 | 7.2 | 29.3 | 27.1 | |
| R1-InstructType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.03 | 20.8 | 21 | 44.9 | 17.1 | 27.5 | 6 | 19.2 | 22.4 |