Multi-Hop Question Answering on HotpotQA (EM, F1aware)
38.2EMSearch-R1
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Search-R1Base Model=Llama-3.2-3B-Instruct, Category=Outcome RL Baselines2025.12 | 38.2 | 6.6 | |
| Search-R1Base Model=Qwen2.5-3B-Instruct, Category=Outcome RL Baselines2025.12 | 36.9 | 0.1 | |
| ADASEARCHBase Model=Llama-3.2-3B-Instruct, Category=Paper Method2025.12 | 34.4 | 59.2 | |
| Awareness ShapingBase Model=Llama-3.2-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 33.7 | 57.5 | |
| ADASEARCHBase Model=Qwen2.5-3B-Instruct, Category=Paper Method2025.12 | 33.4 | 57.5 | |
| IKEABase Model=Llama-3.2-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 32.3 | 58.2 | |
| Awareness ShapingBase Model=Qwen2.5-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 32.1 | 57.5 | |
| IKEABase Model=Qwen2.5-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 32 | 58.1 | |
| Naive ShapingBase Model=Llama-3.2-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 31.2 | 52.6 | |
| Naive ShapingBase Model=Qwen2.5-3B-Instruct, Category=Reward-Shaping Baselines2025.12 | 29.8 | 49.3 | |
| RAGBase Model=Qwen2.5-3B-Instruct, Category=Prompting Baselines2025.12 | 24.6 | 0 | |
| RL w/o searchBase Model=Llama-3.2-3B-Instruct, Category=Outcome RL Baselines2025.12 | 23.7 | 23.7 | |
| RAGBase Model=Llama-3.2-3B-Instruct, Category=Prompting Baselines2025.12 | 20.6 | 0 | |
| RL w/o searchBase Model=Qwen2.5-3B-Instruct, Category=Outcome RL Baselines2025.12 | 20.5 | 20.5 | |
| CoTBase Model=Qwen2.5-3B-Instruct, Category=Prompting Baselines2025.12 | 17.3 | 17.3 | |
| CoTBase Model=Llama-3.2-3B-Instruct, Category=Prompting Baselines2025.12 | 16.3 | 16.3 | |
| Direct AnswerBase Model=Qwen2.5-3B-Instruct, Category=Prompting Baselines2025.12 | 13.2 | 13.2 | |
| Direct AnswerBase Model=Llama-3.2-3B-Instruct, Category=Prompting Baselines2025.12 | 12.5 | 12.5 |