Knowledge-Intensive Reasoning on 2WikiMultiHopQA
81.5AccuracyAPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| APPOBackbone=Qwen2.5-7B-Instruct2026.06 | 81.5 | |
| APPOBackbone=Llama3.1-8B-Instruct2026.06 | 79.8 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | 76.1 | |
| ARPOBackbone=Qwen2.5-7B-Instruct2026.06 | 76.1 | |
| CISPOBackbone=Llama3.1-8B-Instruct2026.06 | 75.6 | |
| ARPOBackbone=Llama3.1-8B-Instruct2026.06 | 75.5 | |
| GIGPOBackbone=Llama3.1-8B-Instruct2026.06 | 74.6 | |
| GPPOBackbone=Qwen2.5-7B-Instruct2026.06 | 74.2 | |
| GIGPOBackbone=Qwen2.5-7B-Instruct2026.06 | 73.5 | |
| GPPOBackbone=Llama3.1-8B-Instruct2026.06 | 72.8 | |
| CISPOBackbone=Qwen2.5-7B-Instruct2026.06 | 72.1 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 71.8 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 71.6 | |
| DAPOBackbone=Llama3.1-8B-Instruct2026.06 | 70.3 | |
| Reinforce++Backbone=Qwen2.5-7B-Instruct2026.06 | 68.9 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.06 | 68.4 | |
| AutoTool (Qwen3-8B)Size=8B, Backbone=Qwen32025.12 | 48.8 | |
| TIR PromptingBackbone=Llama3.1-8B-Instruct2026.06 | 47.5 | |
| Search-R1Size=7B2025.12 | 44.5 | |
| AutoTool (Qwen2.5-VL-7B)Size=7B, Backbone=Qwen2.5-VL2025.12 | 36.5 | |
| GPT4oSize=-2025.12 | 29.8 | |
| Tool-StarBackbone=Qwen2.5-7B, Training Paradigm=SFT–RL TIR, SFT Trajectory Count=54K2026.01 | 29.5 | |
| AutoTrajBackbone=Qwen2.5-7B, Training Paradigm=SFT–RL TIR, SFT Trajectory Count=13K2026.01 | 29.5 | |
| Vanilla SFT-RL TIRBackbone=Qwen2.5-7B, Training Paradigm=SFT–RL TIR2026.01 | 28.5 | |
| ReSearchBackbone=Qwen2.5-7B, Training Paradigm=RL-only2026.01 | 26.5 | |
| AutoTIRBackbone=Qwen2.5-7B, Training Paradigm=RL-only2026.01 | 25 | |
| Zero-shotBackbone=Llama3.1-8B-Instruct2026.06 | 24.6 | |
| QwQ-32BSize=32B2025.12 | 22.3 | |
| Tool-Star-SFTBackbone=Qwen2.5-7B, Training Paradigm=SFT-only, SFT Trajectory Count=54K2026.01 | 21.5 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B, Training Paradigm=Instruct2026.01 | 20.5 | |
| ReToolSize=32B2025.12 | 19.7 | |
| TIR PromptingBackbone=Qwen2.5-7B-Instruct2026.06 | 18.3 | |
| R1-SearcherBackbone=Qwen2.5-7B, Training Paradigm=RL-only2026.01 | 17 | |
| Qwen2.5-Math-72B-InstructSize=72B2025.12 | 16.7 | |
| DeepSeek-R1-Distill-Qwen-14BSize=14B2025.12 | 14.1 | |
| ToRLBackbone=Qwen2.5-7B, Training Paradigm=RL-only2026.01 | 14 | |
| Zero-shotBackbone=Qwen2.5-7B-Instruct2026.06 | 12.6 | |
| Qwen2.5-VL-72B-InstructSize=72B2025.12 | 10.4 |