Knowledge-Intensive Reasoning on 2wikiMultiHopQA (F1 Score)
76.1F1 ScoreQwen2.5-7B + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 76.1 | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 76.1 | |
| Llama3.1-8B + ARPOBase Model=Llama3.1-8B, Algorithm=ARPO2025.12 | 75.5 | |
| Llama3.1-8B + GRPOBase Model=Llama3.1-8B, Algorithm=GRPO2025.12 | 71.8 | |
| Llama3.1-8B + Reinforce ++Base Model=Llama3.1-8B, Algorithm=Reinforce ++2025.12 | 71.6 | |
| Llama3.1-8B + DAPOBase Model=Llama3.1-8B, Algorithm=DAPO2025.12 | 70.3 | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 68.9 | |
| Qwen2.5-7B + DAPOBase Model=Qwen2.5-7B, Algorithm=DAPO2025.12 | 68.4 | |
| Qwen2.5-3B + ARPOBase Model=Qwen2.5-3B, Algorithm=ARPO2025.12 | 67.4 | |
| Qwen2.5-3B + GRPOBase Model=Qwen2.5-3B, Algorithm=GRPO2025.12 | 64.5 | |
| Qwen2.5-3B + DAPOBase Model=Qwen2.5-3B, Algorithm=DAPO2025.12 | 62.5 | |
| Qwen2.5-3B + Reinforce ++Base Model=Qwen2.5-3B, Algorithm=Reinforce ++2025.12 | 62.3 | |
| Llama3.1-8B + TIR PromptingBase Model=Llama3.1-8B, Algorithm=TIR Prompting2025.12 | 47.5 | |
| Llama3.1-8BBase Model=Llama3.1-8B, Algorithm=Direct Reasoning2025.12 | 24.6 | |
| Qwen2.5-7B + TIR PromptingBase Model=Qwen2.5-7B, Algorithm=TIR Prompting2025.12 | 18.3 | |
| Qwen2.5-3B + TIR PromptingBase Model=Qwen2.5-3B, Algorithm=TIR Prompting2025.12 | 14.1 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Algorithm=Direct Reasoning2025.12 | 12.6 | |
| Qwen2.5-3BBase Model=Qwen2.5-3B, Algorithm=Direct Reasoning2025.12 | 9.4 |