Multi-hop Question Answering on MoreHopQA (test)
53.4AccuracyThinkGR
Evaluation Results
| Method | Links | |
|---|---|---|
| ThinkGRRetrieval Strategy Category=Our Method, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 53.4 | |
| ITER-RETGENRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 52.42 | |
| R3-RAGRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 51.34 | |
| GritHopperRetrieval Strategy Category=Reasoning-Augmented Dense Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 48.66 | |
| IRCoTRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 46.78 | |
| RT-RAGRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 44.44 | |
| Auto-RAGRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 41.68 | |
| SelfaskRetrieval Strategy Category=LLM-Driven Multi-Step Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 40.43 | |
| MDRRetrieval Strategy Category=Reasoning-Augmented Dense Retrieval, Answer LLM (Judge LLM)=Llama-3.3-70B-Instruct2026.05 | 39.8 |