Multi-Hop Question Answering on Synthetic Multi-Hop Benchmark 2-hop
1Average F1 ScoreChain-of-Thought (CoT)
Evaluation Results
| Method | Links | |
|---|---|---|
| Chain-of-Thought (CoT)Context Length=0.5k, Backbone=Qwen3-14B2025.09 | 1 | |
| InfoQAContext Length=0.5k, Backbone=Qwen3-14B2025.09 | 1 | |
| InfoQAContext Length=Average, Backbone=Qwen3-14B2025.09 | 0.97 | |
| ReActContext Length=2k, Backbone=Qwen3-8B2025.09 | 0.93 | |
| InfoQAContext Length=10k, Backbone=Qwen3-14B2025.09 | 0.89 | |
| Plan-and-Solve (P&S)Context Length=4k, Backbone=Qwen3-8B2025.09 | 0.78 | |
| DirectContext Length=0.5k, Backbone=Qwen3-14B2025.09 | 0.78 | |
| InfoQAContext Length=10k, Backbone=Qwen3-8B2025.09 | 0.72 | |
| Self-Ask (S-A)Context Length=8k, Backbone=Qwen3-8B2025.09 | 0.67 | |
| DirectContext Length=Average, Backbone=Qwen3-14B2025.09 | 0.52 | |
| DirectContext Length=10k, Backbone=Qwen3-14B2025.09 | 0.18 |