Question Answering on HotpotQA (Context Relevance, Faithfulness, LLM-as-a-Judge)
73LLM Judge ScoreHippoRAG 2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HippoRAG 2LLM=Qwen2.5 7B2026.05 | 73 | — | — | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=true2026.05 | 67 | 89 | 87 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Plan Enhancement=true, Algorithm Config=BS+WC / all2026.05 | 67 | 89 | 87 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever, Plan Enhancement=true2026.05 | 63 | 82 | 85 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms2026.05 | 62 | 65 | 61 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Algorithm Config=BS+WC / all2026.05 | 62 | 65 | 61 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever2026.05 | 50 | 65 | 62 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=false2026.05 | 47 | 71 | 81 | |
| RAPTORLLM=Qwen2.5 7B2026.05 | 46 | — | — | |
| LightRAGLLM=Qwen2.5 7B2026.05 | 15 | — | — |