Hallucination Detection on TriviaQA
0.98AUROCPCNET
Evaluation Results
| Method | Links | ||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PCNETModel=Mistral-7B-v0.32026.05 | 0.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | 96 | — | — | — | — | — | — | — | — | — | |
| PCNETModel=Llama-3.1-8B2026.05 | 0.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | 97 | — | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=DeepSeek-v2-Lite2025.08 | 0.9587 | — | — | — | — | — | — | — | — | — | — | — | — | 89.8 | — | — | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=DeepSeek-v2-Lite2025.08 | 0.9565 | — | — | — | — | — | — | — | — | — | — | — | — | 88.77 | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=DeepSeek-v2-Lite2025.08 | 0.9545 | — | — | — | — | — | — | — | — | — | — | — | — | 88.06 | — | — | — | — | — | — | — | — | — | — | |
| SAPLMA2025.12 | 0.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PCNETModel=Qwen3-4B2026.05 | 0.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | 93 | — | — | — | — | — | — | — | — | — | |
| HaloScopeModel=Llama-3.1-8B2026.05 | 0.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | 92 | — | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Mistral-7B2025.08 | 0.9482 | — | — | — | — | — | — | — | — | — | — | — | — | 87.12 | — | — | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Llama-3.1-8B2025.08 | 0.9478 | — | — | — | — | — | — | — | — | — | — | — | — | 86.52 | — | — | — | — | — | — | — | — | — | — | |
| KSEModel=DeepSeek-v2-Lite2025.08 | 0.9468 | — | — | — | — | — | — | — | — | — | — | — | — | 86.01 | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=Mistral-7B2025.08 | 0.946 | — | — | — | — | — | — | — | — | — | — | — | — | 86.18 | — | — | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Llama-3.1-8B2025.08 | 0.9457 | — | — | — | — | — | — | — | — | — | — | — | — | 86.51 | — | — | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Mistral-7B2025.08 | 0.9448 | — | — | — | — | — | — | — | — | — | — | — | — | 86.18 | — | — | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Llama-2-13B2025.08 | 0.943 | — | — | — | — | — | — | — | — | — | — | — | — | 85.8 | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=Llama-3.1-8B2025.08 | 0.9426 | — | — | — | — | — | — | — | — | — | — | — | — | 84.81 | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=DeepSeek-v2-Lite2025.08 | 0.9401 | — | — | — | — | — | — | — | — | — | — | — | — | 84 | — | — | — | — | — | — | — | — | — | — | |
| LatentAuditModel Backbone=Qwen-3 (8B)2026.04 | 0.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DRIFTModel=Qwen-2.5-7B-Instruct, Input=answer2026.01 | 0.9395 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Llama-2-13B2025.08 | 0.9394 | — | — | — | — | — | — | — | — | — | — | — | — | 84.91 | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=Llama-2-13B2025.08 | 0.9385 | — | — | — | — | — | — | — | — | — | — | — | — | 84.18 | — | — | — | — | — | — | — | — | — | — | |
| LatentAuditModel Backbone=Llama-3 (8B)2026.04 | 0.935 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| αSEModel=DeepSeek-v2-Lite2025.08 | 0.9306 | — | — | — | — | — | — | — | — | — | — | — | — | 84.15 | — | — | — | — | — | — | — | — | — | — | |
| Latent Debate Detector2025.12 | 0.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adaptive Bayesian EstimationLLM=Mistral-Small-24B, Sampling budget (N)=52026.03 | 0.928 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LatentAuditModel Backbone=Qwen-2.5 (7B)2026.04 | 0.928 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KSEModel=Mistral-7B2025.08 | 0.925 | — | — | — | — | — | — | — | — | — | — | — | — | 80.02 | — | — | — | — | — | — | — | — | — | — | |
| HIVEUnderlying D-LLM=Dream-7B-Instruct2026.04 | 0.9236 | — | — | — | — | — | — | — | 95.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HIVEBase LLM=Dream-7B-Instruct2026.04 | 0.9236 | — | — | — | — | — | — | — | 95.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KSEModel=Llama-3.1-8B2025.08 | 0.9231 | — | — | — | — | — | — | — | — | — | — | — | — | 79.75 | — | — | — | — | — | — | — | — | — | — | |
| KSEModel=Llama-2-13B2025.08 | 0.9206 | — | — | — | — | — | — | — | — | — | — | — | — | 78.83 | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Llama-3.1-8B2025.08 | 0.9198 | — | — | — | — | — | — | — | — | — | — | — | — | 81.38 | — | — | — | — | — | — | — | — | — | — | |
| LatentAuditModel Backbone=Mistral (7B)2026.04 | 0.918 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARS (Probing)Model=Qwen3-8B, Single Sampling=true, Supervision=true2026.01 | 0.9162 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LatentAuditModel Backbone=Llama-2 (7B)2026.04 | 0.915 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adaptive Bayesian EstimationLLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.913 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| αSEModel=Llama-3.1-8B2025.08 | 0.9109 | — | — | — | — | — | — | — | — | — | — | — | — | 77.32 | — | — | — | — | — | — | — | — | — | — | |
| CausalGazeLLM=Qwen2-7B2026.04 | 0.9106 | — | — | — | — | 0.828 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Combined: PC + SEBase Model=Qwen3 4B, Base Model Accuracy=52.3%2026.03 | 0.9102 | — | — | — | — | — | — | — | 91.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PCNETModel=Llama-3.2-1B2026.05 | 0.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | 90 | — | — | — | — | — | — | — | — | — | |
| αSEModel=Mistral-7B2025.08 | 0.9097 | — | — | — | — | — | — | — | — | — | — | — | — | 78.02 | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Mistral-7B2025.08 | 0.9093 | — | — | — | — | — | — | — | — | — | — | — | — | 78.39 | — | — | — | — | — | — | — | — | — | — | |
| αSEModel=Llama-2-13B2025.08 | 0.9075 | — | — | — | — | — | — | — | — | — | — | — | — | 78.5 | — | — | — | — | — | — | — | — | — | — | |
| HIVEUnderlying D-LLM=LLaDA-8B-Instruct2026.04 | 0.9066 | — | — | — | — | — | — | — | 93.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HIVEBase LLM=LLaDA-8B-Instruct2026.04 | 0.9066 | — | — | — | — | — | — | — | 93.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G-DetectorModel=Qwen3-8B, Single Sampling=true, Supervision=true2026.01 | 0.9052 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HaluGNNLLM=Qwen2-7B2026.04 | 0.905 | — | — | — | — | 0.8245 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Llama-2-13B2025.08 | 0.9008 | — | — | — | — | — | — | — | — | — | — | — | — | 77.04 | — | — | — | — | — | — | — | — | — | — | |
| Adaptive Bayesian EstimationLLM=Llama-2-7B, Sampling budget (N)=52026.03 | 0.897 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OSCARBackbone=LLaDA-8B-Instruct, Method Category=Traj., Sample Count=128, Evaluation Protocol=LLM-as-Judge2026.04 | 0.897 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TSVModel=Qwen3-8B, Single Sampling=true, Supervision=true2026.01 | 0.8967 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OSCARBackbone=Dream-7B-Instruct, Method Category=Traj., Sample Count=128, Evaluation Protocol=LLM-as-Judge2026.04 | 0.895 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Combined: PC + SE ProbeBase Model=Qwen3 4B, Base Model Accuracy=52.3%2026.03 | 0.8942 | — | — | — | — | — | — | — | 88.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HaluNetBackbone=Llama3-8B, CR=1, Sample Latency=97.663, Inference Latency=0.1242025.12 | 0.893 | — | — | — | 0.977 | 0.601 | 0.984 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| P(True)Backbone=Qwen3-14B, CR=1, Sample Latency=118.871, Inference Latency=53.5932025.12 | 0.891 | — | — | — | 0.937 | 0.727 | 0.961 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DRIFTModel=LLaMA 2 Chat 7B, Input=answer2026.01 | 0.8896 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LSModel=DeepSeek-v2-Lite2025.08 | 0.8889 | — | — | — | — | — | — | — | — | — | — | — | — | 60.32 | — | — | — | — | — | — | — | — | — | — | |
| ARS (CCS)Model=DeepSeek-R1-Distill-Llama-8B, Single Sampling=true, Supervision=false2026.01 | 0.8886 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PC ProbeBase Model=Qwen3 4B, Base Model Accuracy=52.3%2026.03 | 0.8882 | — | — | — | — | — | — | — | 88.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Combined: PC + NLLBase Model=Qwen3 4B, Base Model Accuracy=52.3%2026.03 | 0.8882 | — | — | — | — | — | — | — | 86.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DRIFTModel=Gemma-3-4b-it, Input=answer2026.01 | 0.888 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OSCARBackbone=LLaDA-8B-Instruct, Method Category=Traj., Sample Count=64, Evaluation Protocol=LLM-as-Judge2026.04 | 0.888 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CausalGazeLLM=Mistral-7B2026.04 | 0.888 | — | — | — | — | 0.8113 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCSUnderlying D-LLM=Dream-7B-Instruct2026.04 | 0.8875 | — | — | — | — | — | — | — | 91.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CCSBase LLM=Dream-7B-Instruct2026.04 | 0.8875 | — | — | — | — | — | — | — | 91.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LSModel=Llama-3.1-8B2025.08 | 0.8865 | — | — | — | — | — | — | — | — | — | — | — | — | 58.28 | — | — | — | — | — | — | — | — | — | — | |
| ARS (CCS)Model=Qwen3-8B, Single Sampling=true, Supervision=false2026.01 | 0.8854 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Semantic EntropyBase Model=Llama 3.2 3B, Base Model Accuracy=64.2%2026.03 | 0.8842 | — | — | — | — | — | — | — | 76.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SinkProbeLLM=Llama3.1-8B2026.04 | 0.883 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Val LossBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8805 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FEPoIDBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8805 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HaloScopeModel=Mistral-7B-v0.32026.05 | 0.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | 87 | — | — | — | — | — | — | — | — | — | |
| Val LossBackbone=LlaMA-3.1-8B, Forward horizon (w)=7, Representation extraction method=FST, Model tuning status=non-instruction-tuned (base model)2026.05 | 0.8799 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FEPoIDBackbone=LlaMA-3.1-8B, Forward horizon (w)=7, Representation extraction method=FST, Model tuning status=non-instruction-tuned (base model)2026.05 | 0.8799 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FEPoIDBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8782 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SinkProbeLLM=Mistral-Nemo2026.04 | 0.878 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SinkProbeLLM=Phi3.52026.04 | 0.877 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARS (Probing)Model=DeepSeek-R1-Distill-Llama-8B, Single Sampling=true, Supervision=true2026.01 | 0.8745 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LapEigvalLLM=Llama3.1-8B2026.04 | 0.874 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MTopDivLLM=Llama3.1-8B2026.04 | 0.874 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HaluGNNLLM=Mistral-7B2026.04 | 0.8735 | — | — | — | — | 0.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SEModel=DeepSeek-v2-Lite2025.08 | 0.8734 | — | — | — | — | — | — | — | — | — | — | — | — | 75.43 | — | — | — | — | — | — | — | — | — | — | |
| DRIFTModel=Qwen-2.5-7B-Instruct, Input=question2026.01 | 0.8731 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Val LossBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8731 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DynHDBackbone=Dream-7B-Instruct, Method Category=Traj., Sample Count=128, Evaluation Protocol=LLM-as-Judge, Requires trained classifier=true2026.04 | 0.873 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adaptive Bayesian EstimationLLM=Mistral-Small-24B, Sampling budget (N)=22026.03 | 0.872 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpikeScoreLLM Backbone=Qwen3-14B, Method Category=Cross-domain specialized methods2026.01 | 0.8697 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LookbackLensLLM=Llama3.1-8B2026.04 | 0.868 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CurvatureBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.868 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DynHDBackbone=LLaDA-8B-Instruct, Method Category=Traj., Sample Count=128, Evaluation Protocol=LLM-as-Judge, Requires trained classifier=true2026.04 | 0.867 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TraceDetBackbone=Dream-7B-Instruct, Method Category=Traj., Sample Count=64, Evaluation Protocol=LLM-as-Judge, Requires trained classifier=true2026.04 | 0.867 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SELLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.866 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MTopDivLLM=Phi3.52026.04 | 0.866 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LookbackLensLLM=Mistral-Nemo2026.04 | 0.866 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RACEModel=Qwen3-8B, Single Sampling=false, Supervision=false2026.01 | 0.8657 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HaloScopeModel=Qwen-2.5-7B-Instruct, Input=answer2026.01 | 0.8654 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MTopDivLLM=Mistral-Nemo2026.04 | 0.865 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Combined: PC + SEBase Model=Llama 3.2 3B, Base Model Accuracy=64.2%2026.03 | 0.8632 | — | — | — | — | — | — | — | 77.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OSCARBackbone=Dream-7B-Instruct, Method Category=Traj., Sample Count=64, Evaluation Protocol=LLM-as-Judge2026.04 | 0.863 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EmbRegressModel=Meta-Llama-3-8B-Instruct, Category=Multi-trajectory / LLM-based2026.05 | 0.863 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |