Question Answering on MuSiQue (Context Relevance, Faithfulness, LLM-as-a-Judge)
0.33LLM-as-a-Judge ScorePAI-2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=true2026.05 | 0.33 | 0.66 | 0.87 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Plan Enhancement=true, Algorithm Config=BS+WC / all2026.05 | 0.33 | 0.66 | 0.87 | |
| HippoRAG 2LLM=Qwen2.5 7B2026.05 | 0.29 | — | — | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever, Plan Enhancement=true2026.05 | 0.28 | 0.68 | 0.86 | |
| RAPTORLLM=Qwen2.5 7B2026.05 | 0.22 | — | — | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=Combined Retrieval (best), Algorithm Config=BS+NR / all2026.05 | 0.17 | 0.35 | 0.36 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Naive Retriever2026.05 | 0.12 | 0.32 | 0.46 | |
| PAI-1LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms2026.05 | 0.12 | 0.32 | 0.65 | |
| PAI-2LLM=Qwen2.5 7B, Retrieval Mode=only Traversal Algorithms, Plan Enhancement=false2026.05 | 0.08 | 0.34 | 0.8 | |
| LightRAGLLM=Qwen2.5 7B2026.05 | 0.01 | — | — |