Hallucination Detection on RAGTruth
0.8535AUROCSpikeScore
Evaluation Results
| Method | Links | |
|---|---|---|
| SpikeScoreLLM Backbone=Qwen3-14B, Method Category=Cross-domain specialized methods2026.01 | 0.8535 | |
| SpikeScoreLLM Backbone=Qwen3-8B, Method Category=Cross-domain specialized methods2026.01 | 0.8291 | |
| SpikeScoreLLM Backbone=Llama3.1-8B, Method Category=Cross-domain specialized methods2026.01 | 0.8154 | |
| D: Act. VarianceBackbone=Llama-3.3-70B2026.05 | 0.78 | |
| ICR ProbeLLM Backbone=Qwen3-14B, Method Category=Cross-domain specialized methods2026.01 | 0.7653 | |
| SpikeScoreLLM Backbone=Llama3.2-3B, Method Category=Cross-domain specialized methods2026.01 | 0.7631 | |
| ICR ProbeLLM Backbone=Qwen3-8B, Method Category=Cross-domain specialized methods2026.01 | 0.7426 | |
| ICR ProbeLLM Backbone=Llama3.2-3B, Method Category=Cross-domain specialized methods2026.01 | 0.7416 | |
| ICR ProbeLLM Backbone=Llama3.1-8B, Method Category=Cross-domain specialized methods2026.01 | 0.7405 | |
| EigenScoreLLM Backbone=Llama3.1-8B, Method Category=Training-free methods2026.01 | 0.6974 | |
| Lexical SimilarityLLM Backbone=Llama3.1-8B, Method Category=Training-free methods2026.01 | 0.6958 | |
| EigenScoreLLM Backbone=Qwen3-14B, Method Category=Training-free methods2026.01 | 0.6904 | |
| Semantic EntropyLLM Backbone=Qwen3-14B, Method Category=Training-free methods2026.01 | 0.6796 | |
| Attention probeModel=Llama-2-13B, Generation Phase=Pre-generation2026.06 | 0.6734 | |
| EntropyModel=Mistral-7B, Generation Phase=Post-generation2026.06 | 0.6671 | |
| Attention probeModel=Mistral-7B, Generation Phase=Post-generation2026.06 | 0.6531 | |
| Attention probeModel=Mistral-7B, Generation Phase=Pre-generation2026.06 | 0.6524 | |
| Lexical SimilarityLLM Backbone=Qwen3-14B, Method Category=Training-free methods2026.01 | 0.6479 | |
| Lexical SimilarityLLM Backbone=Qwen3-8B, Method Category=Training-free methods2026.01 | 0.644 | |
| PerplexityLLM Backbone=Qwen3-14B, Method Category=Training-free methods2026.01 | 0.642 | |
| Semantic EntropyLLM Backbone=Qwen3-8B, Method Category=Training-free methods2026.01 | 0.6388 | |
| SAPLMALLM Backbone=Qwen3-14B, Method Category=Training-based methods2026.01 | 0.6338 | |
| EigenScoreLLM Backbone=Llama3.2-3B, Method Category=Training-free methods2026.01 | 0.6329 | |
| EigenScoreLLM Backbone=Qwen3-8B, Method Category=Training-free methods2026.01 | 0.6292 | |
| PerplexityLLM Backbone=Qwen3-8B, Method Category=Training-free methods2026.01 | 0.6284 | |
| EntropyModel=Llama-2-7B, Generation Phase=Post-generation2026.06 | 0.6263 | |
| Semantic EntropyLLM Backbone=Llama3.2-3B, Method Category=Training-free methods2026.01 | 0.621 | |
| MMLLM Backbone=Qwen3-14B, Method Category=Training-based methods2026.01 | 0.6191 | |
| Lexical SimilarityLLM Backbone=Llama3.2-3B, Method Category=Training-free methods2026.01 | 0.6179 | |
| PerplexityLLM Backbone=Llama3.1-8B, Method Category=Training-free methods2026.01 | 0.6151 | |
| Linear probeModel=Llama-2-13B, Generation Phase=Pre-generation2026.06 | 0.6104 | |
| Linear probeModel=Llama-2-13B, Generation Phase=Post-generation2026.06 | 0.6071 | |
| MMLLM Backbone=Qwen3-8B, Method Category=Training-based methods2026.01 | 0.6044 | |
| Attention probeModel=Llama-2-13B, Generation Phase=Post-generation2026.06 | 0.6041 | |
| Semantic EntropyLLM Backbone=Llama3.1-8B, Method Category=Training-free methods2026.01 | 0.6037 | |
| SAPLMALLM Backbone=Llama3.1-8B, Method Category=Training-based methods2026.01 | 0.6011 | |
| Linear probeModel=Mistral-7B, Generation Phase=Pre-generation2026.06 | 0.5987 | |
| Linear probeModel=Mistral-7B, Generation Phase=Post-generation2026.06 | 0.5984 | |
| PerplexityLLM Backbone=Llama3.2-3B, Method Category=Training-free methods2026.01 | 0.5936 | |
| SAPLMALLM Backbone=Qwen3-8B, Method Category=Training-based methods2026.01 | 0.5904 | |
| SAPLMALLM Backbone=Llama3.2-3B, Method Category=Training-based methods2026.01 | 0.5874 | |
| MMLLM Backbone=Llama3.1-8B, Method Category=Training-based methods2026.01 | 0.5839 | |
| A: PerturbationBackbone=Llama-3.3-70B2026.05 | 0.57 | |
| F: Ans. Expect.Backbone=Llama-3.3-70B2026.05 | 0.57 | |
| Attention probeModel=Llama-2-7B, Generation Phase=Post-generation2026.06 | 0.5637 | |
| Attention probeModel=Llama-2-7B, Generation Phase=Pre-generation2026.06 | 0.562 | |
| MMLLM Backbone=Llama3.2-3B, Method Category=Training-based methods2026.01 | 0.5587 | |
| SEPLLM Backbone=Llama3.1-8B, Method Category=Training-based methods2026.01 | 0.5547 | |
| Question lengthModel=Llama-2-7B, Generation Phase=Pre-generation2026.06 | 0.5518 | |
| ACT (detect)Backbone=Llama-3.3-70B2026.05 | 0.55 | |
| P(True)Backbone=Llama-3.3-70B2026.05 | 0.55 | |
| Self-checkModel=Mistral-7B, Generation Phase=Pre-generation, mode=zero-shot2026.06 | 0.5485 | |
| SelfCheckGPT-NLIBackbone=Llama-3.3-70B2026.05 | 0.54 | |
| Self-checkModel=Llama-2-7B, Generation Phase=Pre-generation, mode=zero-shot2026.06 | 0.5397 | |
| Linear probeModel=Llama-2-7B, Generation Phase=Post-generation2026.06 | 0.5363 | |
| Linear probeModel=Llama-2-7B, Generation Phase=Pre-generation2026.06 | 0.5358 | |
| Question lengthModel=Llama-2-13B, Generation Phase=Pre-generation2026.06 | 0.5301 | |
| SEPLLM Backbone=Qwen3-8B, Method Category=Training-based methods2026.01 | 0.5253 | |
| Question lengthModel=Mistral-7B, Generation Phase=Pre-generation2026.06 | 0.5247 | |
| SEPLLM Backbone=Qwen3-14B, Method Category=Training-based methods2026.01 | 0.5239 | |
| EntropyModel=Llama-2-13B, Generation Phase=Post-generation2026.06 | 0.5234 | |
| Self-checkModel=Llama-2-13B, Generation Phase=Pre-generation, mode=zero-shot2026.06 | 0.5233 | |
| C: Sem. EntropyBackbone=Llama-3.3-70B2026.05 | 0.52 | |
| DRIFT-logpBackbone=Llama-3.3-70B2026.05 | 0.52 | |
| HalluShiftBackbone=Llama-3.3-70B2026.05 | 0.52 | |
| Log-ProbBackbone=Llama-3.3-70B2026.05 | 0.52 | |
| MINDBackbone=Llama-3.3-70B2026.05 | 0.51 | |
| HaloScopeBackbone=Llama-3.3-70B2026.05 | 0.51 | |
| Ensemble A+C+E+FBackbone=Llama-3.3-70B2026.05 | 0.5 | |
| INSIDEBackbone=Llama-3.3-70B2026.05 | 0.5 | |
| IRIS⋆ (self-verify)Backbone=Llama-3.3-70B2026.05 | 0.5 | |
| DoLaBackbone=Llama-3.3-70B2026.05 | 0.5 | |
| SEPLLM Backbone=Llama3.2-3B, Method Category=Training-based methods2026.01 | 0.4988 | |
| SEPsBackbone=Llama-3.3-70B2026.05 | 0.49 | |
| E: DRIFTBackbone=Llama-3.3-70B2026.05 | 0.47 | |
| DRIFT-concat (ablation of E)Backbone=Llama-3.3-70B2026.05 | 0.47 | |
| HaMIBackbone=Llama-3.3-70B2026.05 | 0.46 | |
| SAPLMABackbone=Llama-3.3-70B2026.05 | 0.46 | |
| PRISMBackbone=Llama-3.3-70B2026.05 | 0.39 |