Multi-hop Question Answering on Bamboogle (Acc, LLM)
45.6AccuracyAutoAgent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AutoAgent2026.03 | 45.6 | 44.8 | |
| Self-Ask2026.03 | 33.6 | 41.6 | |
| Standard RAG2026.03 | 27.2 | 32.8 | |
| IRCoT2026.03 | 27.2 | 18.4 | |
| LongLLMLingua2026.03 | 24.8 | 28.8 | |
| SKR2026.03 | 24.8 | 28.8 | |
| Naive Generation2026.03 | 24 | 28 | |
| Selective-Context2026.03 | 24 | 28.8 | |
| Iter-RetGen2026.03 | 23.2 | 25.6 | |
| REPLUG2026.03 | 22.4 | 25.6 | |
| SuRe2026.03 | 16.8 | 20.8 | |
| RECOMP2026.03 | 13.6 | 17.6 |