Knowledge-Intensive Reasoning on WebWalker (accuracy)
33.5WebWalker AccuracyAPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| APPOBackbone=Qwen2.5-7B-Instruct2026.06 | 33.5 | |
| APPOBackbone=Llama3.1-8B-Instruct2026.06 | 32 | |
| GIGPOBackbone=Llama3.1-8B-Instruct2026.06 | 31.5 | |
| GPPOBackbone=Qwen2.5-7B-Instruct2026.06 | 31 | |
| ARPOBackbone=Llama3.1-8B-Instruct2026.06 | 30.5 | |
| GIGPOBackbone=Qwen2.5-7B-Instruct2026.06 | 30.5 | |
| CISPOBackbone=Qwen2.5-7B-Instruct2026.06 | 29 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 27.5 | |
| GPPOBackbone=Llama3.1-8B-Instruct2026.06 | 27.5 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 26.5 | |
| CISPOBackbone=Llama3.1-8B-Instruct2026.06 | 26 | |
| Reinforce++Backbone=Qwen2.5-7B-Instruct2026.06 | 26 | |
| ARPOBackbone=Qwen2.5-7B-Instruct2026.06 | 26 | |
| DAPOBackbone=Llama3.1-8B-Instruct2026.06 | 25.5 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.06 | 24 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | 22 | |
| TIR PromptingBackbone=Qwen2.5-7B-Instruct2026.06 | 15.5 | |
| TIR PromptingBackbone=Llama3.1-8B-Instruct2026.06 | 15 | |
| Zero-shotBackbone=Llama3.1-8B-Instruct2026.06 | 3 | |
| Zero-shotBackbone=Qwen2.5-7B-Instruct2026.06 | 2 |