Hallucination Mitigation on KG-FPQ
95.2AccuracyRetrieval-Augmented Logical Reasoning
Evaluation Results
| Method | Links | |
|---|---|---|
| Retrieval-Augmented Logical ReasoningBackbone=Qwen2.52025.04 | 95.2 | |
| Retrieval-Augmented Logical ReasoningBackbone=GPT-3.52025.04 | 94.3 | |
| DirectAskBackbone=GPT-3.52025.04 | 93.3 | |
| PromptBackbone=GPT-3.52025.04 | 93.3 | |
| PromptBackbone=GPT-4o-mini2025.04 | 92.4 | |
| Retrieval-Augmented Logical ReasoningBackbone=GPT-4o-mini2025.04 | 92.4 | |
| MajVoteBackbone=GPT-3.52025.04 | 92.4 | |
| DirectAskBackbone=Qwen2.52025.04 | 92.4 | |
| MajVoteBackbone=Qwen2.52025.04 | 92.4 | |
| DirectRAGBackbone=Qwen2.52025.04 | 92.4 | |
| Retrieval-Augmented Logical ReasoningBackbone=Qwen1.52025.04 | 91.4 | |
| Perplexity AIBackbone=GPT-4-Omni2025.04 | 91.4 | |
| DirectRAGBackbone=GPT-4o-mini2025.04 | 90.5 | |
| DirectRAGBackbone=GPT-3.52025.04 | 90.5 | |
| PromptBackbone=Qwen1.52025.04 | 90.5 | |
| MajVoteBackbone=Qwen1.52025.04 | 90.5 | |
| MajVoteBackbone=LLama-3.12025.04 | 89.5 | |
| Retrieval-Augmented Logical ReasoningBackbone=LLama-3.12025.04 | 89.5 | |
| Retrieval-Augmented Logical ReasoningBackbone=Mistral-7B2025.04 | 89.5 | |
| DirectAskBackbone=Qwen1.52025.04 | 89.5 | |
| DirectRAGBackbone=LLama-3.12025.04 | 88.6 | |
| DirectAskBackbone=Mistral-7B2025.04 | 87.6 | |
| MajVoteBackbone=Mistral-7B2025.04 | 87.6 | |
| MajVoteBackbone=GPT-4o-mini2025.04 | 86.7 | |
| DirectAskBackbone=LLama-3.12025.04 | 86.7 | |
| PromptBackbone=LLama-3.12025.04 | 86.7 | |
| PromptBackbone=Mistral-7B2025.04 | 86.7 | |
| PromptBackbone=Qwen2.52025.04 | 86.7 | |
| DirectAskBackbone=GPT-4o-mini2025.04 | 83.8 | |
| DirectRAGBackbone=Qwen1.52025.04 | 82.9 | |
| DirectRAGBackbone=Mistral-7B2025.04 | 71.4 |