Knowledge-Intensive Reasoning on WebWalker
30.5F1 ScoreLlama3.1-8B + ARPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-8B + ARPOBase Model=Llama3.1-8B, Algorithm=ARPO2025.12 | 30.5 | |
| Llama3.1-8B + Reinforce ++Base Model=Llama3.1-8B, Algorithm=Reinforce ++2025.12 | 27.5 | |
| Llama3.1-8B + GRPOBase Model=Llama3.1-8B, Algorithm=GRPO2025.12 | 26.5 | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 26 | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 26 | |
| Llama3.1-8B + DAPOBase Model=Llama3.1-8B, Algorithm=DAPO2025.12 | 25.5 | |
| Qwen2.5-3B + ARPOBase Model=Qwen2.5-3B, Algorithm=ARPO2025.12 | 24.5 | |
| Qwen2.5-7B + DAPOBase Model=Qwen2.5-7B, Algorithm=DAPO2025.12 | 24 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 22 | |
| Qwen2.5-3B + GRPOBase Model=Qwen2.5-3B, Algorithm=GRPO2025.12 | 21 | |
| Qwen2.5-3B + Reinforce ++Base Model=Qwen2.5-3B, Algorithm=Reinforce ++2025.12 | 19.5 | |
| Qwen2.5-3B + DAPOBase Model=Qwen2.5-3B, Algorithm=DAPO2025.12 | 19.5 | |
| Qwen2.5-7B + TIR PromptingBase Model=Qwen2.5-7B, Algorithm=TIR Prompting2025.12 | 15.5 | |
| Llama3.1-8B + TIR PromptingBase Model=Llama3.1-8B, Algorithm=TIR Prompting2025.12 | 15 | |
| Qwen2.5-3B + TIR PromptingBase Model=Qwen2.5-3B, Algorithm=TIR Prompting2025.12 | 14 | |
| Llama3.1-8BBase Model=Llama3.1-8B, Algorithm=Direct Reasoning2025.12 | 3 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Algorithm=Direct Reasoning2025.12 | 2 | |
| Qwen2.5-3BBase Model=Qwen2.5-3B, Algorithm=Direct Reasoning2025.12 | 0.5 |