Hallucination Detection on MetaQA 1hop (LLaMA2-7B)
83.41AUCGGA (PRD + SAS)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GGA (PRD + SAS)Category=Our Method, LLM=LLaMA2-7B2025.12 | 83.41 | 53.9 | 75.24 | 56.32 | 51.68 | |
| Embedding DivergenceCategory=Semantic Consistency, LLM=LLaMA2-7B2025.12 | 69.14 | 29.55 | 50.94 | 19.14 | 64.76 | |
| BERTScoreCategory=Semantic Consistency, LLM=LLaMA2-7B2025.12 | 63.66 | 27.4 | 50.92 | 18.2 | 55.44 | |
| NLI ContradictionCategory=Semantic Consistency, LLM=LLaMA2-7B2025.12 | 57.41 | 25.67 | 35.24 | 15.12 | 36.67 | |
| Token confidenceCategory=Model-Internal Confidence, LLM=LLaMA2-7B2025.12 | 50.2 | 20.2 | 45.29 | 13.24 | 42.49 | |
| Max token probabilityCategory=Model-Internal Confidence, LLM=LLaMA2-7B2025.12 | 50 | 29.6 | 44.78 | 13.22 | 44.04 | |
| PerplexityCategory=Model-Internal Confidence, LLM=LLaMA2-7B2025.12 | 45.78 | 25.6 | 21.26 | 14.84 | 93.1 |