Multi-Hop Question Answering on 2Wiki Platinum (test)
84.8Answer RatePANINI
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PANINIRetrieval Paradigm=Structure-Augmented RAG, LLM Evaluator=GPT-4o-mini2026.02 | 84.8 | 73.1 | |
| HippoRAG 2Retrieval Paradigm=Structure-Augmented RAG, LLM Evaluator=GPT-4o-mini2026.02 | 81.5 | 66.7 | |
| Qwen3 + rerankerRetrieval Paradigm=Dense Retrieval, Backbone model=Qwen3, Reranker usage=True, LLM Evaluator=GPT-4o-mini2026.02 | 63.8 | 67.7 | |
| Qwen3 (8B)Retrieval Paradigm=Dense Retrieval, Backbone model=Qwen3 (8B), LLM Evaluator=GPT-4o-mini2026.02 | 63.5 | 70.9 | |
| BM25 + rerankerRetrieval Paradigm=Sparse Retrieval, Reranker usage=True, LLM Evaluator=GPT-4o-mini2026.02 | 47.9 | 78.7 | |
| BM25Retrieval Paradigm=Sparse Retrieval, LLM Evaluator=GPT-4o-mini2026.02 | 37.9 | 79.8 |