Multi-Hop Question Answering on MuSiQue Platinum (test)
0.75Ans RatePANINI
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PANINIRetrieval Paradigm=Structure-Augmented RAG, LLM Evaluator=GPT-4o-mini2026.02 | 0.75 | 0.726 | |
| HippoRAG 2Retrieval Paradigm=Structure-Augmented RAG, LLM Evaluator=GPT-4o-mini2026.02 | 0.636 | 0.503 | |
| Qwen3 + rerankerRetrieval Paradigm=Dense Retrieval, Backbone model=Qwen3, Reranker usage=True, LLM Evaluator=GPT-4o-mini2026.02 | 0.597 | 0.628 | |
| Qwen3 (8B)Retrieval Paradigm=Dense Retrieval, Backbone model=Qwen3 (8B), LLM Evaluator=GPT-4o-mini2026.02 | 0.533 | 0.634 | |
| BM25 + rerankerRetrieval Paradigm=Sparse Retrieval, Reranker usage=True, LLM Evaluator=GPT-4o-mini2026.02 | 0.423 | 0.745 | |
| BM25Retrieval Paradigm=Sparse Retrieval, LLM Evaluator=GPT-4o-mini2026.02 | 0.35 | 0.784 |