Question Answering on 2WikiMultihopQA (Generative Quality Metrics)
0.58LLM-as-a-Judge ScorePAI-2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Plan Enhancement=true, Algorithm Config=BS+NR / all2026.05 | 0.58 | 0.74 | 0.74 | |
| HippoRAG 2LLM=Qwen2.5 7B2026.05 | 0.56 | — | — | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=true2026.05 | 0.54 | 0.74 | 0.8 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever, Plan Enhancement=true2026.05 | 0.48 | 0.6 | 0.78 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Algorithm Config=BS+NR / all2026.05 | 0.4 | 0.46 | 0.5 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms2026.05 | 0.34 | 0.45 | 0.35 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever2026.05 | 0.29 | — | — | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=false2026.05 | 0.28 | 0.44 | 0.84 | |
| RAPTORLLM=Qwen2.5 7B2026.05 | 0.27 | — | — | |
| LightRAGLLM=Qwen2.5 7B2026.05 | 0.11 | — | — |