Hallucination Detection on HaluEval
1AUROCStacking
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| StackingAnalyzer=Qwen2.5-7B2026.05 | 1 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=Gemma-2-9B2026.05 | 1 | — | — | — | — | — | — | — | — | — | — | — | |
| B: CAABackbone=Llama-3.3-70B2026.05 | 1 | — | — | — | — | — | — | — | — | — | — | — | |
| F: Ans. Expect.Backbone=Llama-3.3-70B2026.05 | 1 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=Qwen2.5-0.5B2026.05 | 0.999 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=Gemma-2-2B2026.05 | 0.999 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=LLaMA-3-3B2026.05 | 0.999 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=LLaMA-3-8B2026.05 | 0.999 | — | — | — | — | — | — | — | — | — | — | — | |
| StackingAnalyzer=Pythia-1.4B2026.05 | 0.997 | — | — | — | — | — | — | — | — | — | — | — | |
| Ensemble A+C+E+FBackbone=Llama-3.3-70B2026.05 | 0.99 | — | — | — | — | — | — | — | — | — | — | — | |
| TXTEMB (ctrl)Backbone=Llama-3.3-70B2026.05 | 0.98 | — | — | — | — | — | — | — | — | — | — | — | |
| E: DRIFTBackbone=Llama-3.3-70B2026.05 | 0.96 | — | — | — | — | — | — | — | — | — | — | — | |
| DRIFT-concat (ablation of E)Backbone=Llama-3.3-70B2026.05 | 0.95 | — | — | — | — | — | — | — | — | — | — | — | |
| TeacherDeployability=non-deployable2026.05 | 0.94 | — | — | — | — | — | — | — | — | — | — | — | |
| CausalGazeLLM=Llama2-7B2026.04 | 0.928 | — | 80.01 | — | — | — | — | — | — | — | — | — | |
| CausalGazeLLM=Qwen2-7B2026.04 | 0.922 | — | 83.6 | — | — | — | — | — | — | — | — | — | |
| HaluGNNLLM=Llama2-7B2026.04 | 0.9141 | — | 63.16 | — | — | — | — | — | — | — | — | — | |
| CausalGazeLLM=Mistral-7B2026.04 | 0.9127 | — | 82.92 | — | — | — | — | — | — | — | — | — | |
| HaluGNNLLM=Qwen2-7B2026.04 | 0.9065 | — | 80.58 | — | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Llama-3.1-8B2025.08 | 0.9056 | — | — | 74.93 | — | — | — | — | — | — | — | — | |
| KSEModel=DeepSeek-v2-Lite2025.08 | 0.9043 | — | — | 72.27 | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=DeepSeek-v2-Lite2025.08 | 0.9027 | — | — | 76.79 | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Llama-2-13B2025.08 | 0.9018 | — | — | 75.7 | — | — | — | — | — | — | — | — | |
| KSEModel=Llama-2-13B2025.08 | 0.8941 | — | — | 71.21 | — | — | — | — | — | — | — | — | |
| KSEModel=Llama-3.1-8B2025.08 | 0.8932 | — | — | 69.35 | — | — | — | — | — | — | — | — | |
| LSModel=Llama-3.1-8B2025.08 | 0.8922 | — | — | 64.34 | — | — | — | — | — | — | — | — | |
| KSEModel=Mistral-7B2025.08 | 0.8885 | — | — | 69.9 | — | — | — | — | — | — | — | — | |
| LSModel=Llama-2-13B2025.08 | 0.8877 | — | — | 64.81 | — | — | — | — | — | — | — | — | |
| Multiple Hypothesis Testing for Hallucination DetectionModel=Mistral-7B2025.08 | 0.8871 | — | — | 71.74 | — | — | — | — | — | — | — | — | |
| StudentDeployability=deployable2026.05 | 0.884 | — | — | — | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=DeepSeek-v2-Lite2025.08 | 0.8748 | — | — | 71.32 | — | — | — | — | — | — | — | — | |
| EigVModel=DeepSeek-v2-Lite2025.08 | 0.8716 | — | — | 67.49 | — | — | — | — | — | — | — | — | |
| DRIFT-logpBackbone=Llama-3.3-70B2026.05 | 0.87 | — | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=Llama-2-13B2025.08 | 0.8659 | — | — | 71.02 | — | — | — | — | — | — | — | — | |
| HaluGNNLLM=Mistral-7B2026.04 | 0.8647 | — | 80.3 | — | — | — | — | — | — | — | — | — | |
| HaMIBackbone=Llama-3.3-70B2026.05 | 0.86 | — | — | — | — | — | — | — | — | — | — | — | |
| FESSignal=Free-energy + SFF2026.06 | 0.86 | — | — | — | — | — | — | — | — | — | — | — | |
| EigVModel=Llama-3.1-8B2025.08 | 0.859 | — | — | 65.39 | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Llama-2-13B2025.08 | 0.8583 | — | — | 71.77 | — | — | — | — | — | — | — | — | |
| EigVModel=Mistral-7B2025.08 | 0.8583 | — | — | 64.44 | — | — | — | — | — | — | — | — | |
| LSModel=Mistral-7B2025.08 | 0.8562 | — | — | 45.74 | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Mistral-7B2025.08 | 0.8553 | — | — | 67.32 | — | — | — | — | — | — | — | — | |
| α_clustered_SEModel=Llama-3.1-8B2025.08 | 0.854 | — | — | 68.18 | — | — | — | — | — | — | — | — | |
| LSModel=DeepSeek-v2-Lite2025.08 | 0.8519 | — | — | 41.28 | — | — | — | — | — | — | — | — | |
| Best rep.Description=Strongest reported reference hidden-state or sampling baseline2026.06 | 0.85 | — | — | — | — | — | — | — | — | — | — | — | |
| αSEModel=DeepSeek-v2-Lite2025.08 | 0.8454 | — | — | 68.84 | — | — | — | — | — | — | — | — | |
| clustered_SEModel=DeepSeek-v2-Lite2025.08 | 0.8349 | — | — | 60.7 | — | — | — | — | — | — | — | — | |
| ICR-ProbeLLM=Llama2-7B2026.04 | 0.8346 | — | 80.32 | — | — | — | — | — | — | — | — | — | |
| αSEModel=Llama-2-13B2025.08 | 0.8343 | — | — | 66.46 | — | — | — | — | — | — | — | — | |
| Best spec.Description=Strongest non-FES in-tree attention-spectral baseline2026.06 | 0.83 | — | — | — | — | — | — | — | — | — | — | — | |
| αSEModel=Llama-3.1-8B2025.08 | 0.818 | — | — | 62.97 | — | — | — | — | — | — | — | — | |
| ICR-ProbeLLM=Mistral-7B2026.04 | 0.8047 | — | 81.2 | — | — | — | — | — | — | — | — | — | |
| αSEModel=Mistral-7B2025.08 | 0.8036 | — | — | 60.95 | — | — | — | — | — | — | — | — | |
| ICR ProbeModel=Qwen2.5-14B2025.07 | 0.8021 | — | — | — | — | — | — | — | — | — | — | — | |
| ICR-ProbeLLM=Qwen2-7B2026.04 | 0.8003 | — | 77.3 | — | — | — | — | — | — | — | — | — | |
| ICR ProbeModel=Qwen2.5-3B2025.07 | 0.7917 | — | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Llama-3.1-8B2025.08 | 0.7882 | — | — | 51.99 | — | — | — | — | — | — | — | — | |
| SAPLMALLM=Mistral-7B2026.04 | 0.788 | — | 77.29 | — | — | — | — | — | — | — | — | — | |
| Linear Probe2026.05 | 0.786 | — | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Llama-2-13B2025.08 | 0.7832 | — | — | 51.03 | — | — | — | — | — | — | — | — | |
| FEPoIDModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7808 | — | — | — | — | — | — | — | — | — | — | — | |
| clustered_SEModel=Mistral-7B2025.08 | 0.7804 | — | — | 50.06 | — | — | — | — | — | — | — | — | |
| SAPLMALLM=Qwen2-7B2026.04 | 0.7799 | — | 78.84 | — | — | — | — | — | — | — | — | — | |
| SAPLMALLM=Llama2-7B2026.04 | 0.7738 | — | 69.36 | — | — | — | — | — | — | — | — | — | |
| SAPLMAModel=Qwen2.5-14B2025.07 | 0.772 | — | — | — | — | — | — | — | — | — | — | — | |
| RGNModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7563 | — | — | — | — | — | — | — | — | — | — | — | |
| SAPLMAModel=Qwen2.5-3B2025.07 | 0.7538 | — | — | — | — | — | — | — | — | — | — | — | |
| CurvatureModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7498 | — | — | — | — | — | — | — | — | — | — | — | |
| IDModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7498 | — | — | — | — | — | — | — | — | — | — | — | |
| SNRModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7385 | — | — | — | — | — | — | — | — | — | — | — | |
| LN-EntropyLLM=Qwen2-7B2026.04 | 0.7371 | — | 68.5 | — | — | — | — | — | — | — | — | — | |
| Val LossModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7294 | — | — | — | — | — | — | — | — | — | — | — | |
| LN-EntropyLLM=Mistral-7B2026.04 | 0.7156 | — | 65.8 | — | — | — | — | — | — | — | — | — | |
| RankMeModel=Mistral-7B-Instruct-v0.3, w=7, FST=false2026.05 | 0.7149 | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oModel=Llama-3-8B, Scorer Family=Judge2026.06 | 0.704 | — | — | — | — | — | — | — | — | — | — | — | |
| SEModel=DeepSeek-v2-Lite2025.08 | 0.7036 | — | — | 50.99 | — | — | — | — | — | — | — | — | |
| SEPModel=Qwen2.5-14B2025.07 | 0.7016 | — | — | — | — | — | — | — | — | — | — | — | |
| D: Act. VarianceBackbone=Llama-3.3-70B2026.05 | 0.69 | — | — | — | — | — | — | — | — | — | — | — | |
| EigenScoreLLM=Qwen2-7B2026.04 | 0.684 | — | 63.43 | — | — | — | — | — | — | — | — | — | |
| Semantic EntropyLLM=Llama2-7B2026.04 | 0.682 | — | 68.65 | — | — | — | — | — | — | — | — | — | |
| SelfCheckGPTLLM=Mistral-7B2026.04 | 0.6729 | — | 63.57 | — | — | — | — | — | — | — | — | — | |
| SEPModel=Qwen2.5-3B2025.07 | 0.6689 | — | — | — | — | — | — | — | — | — | — | — | |
| Semantic EntropyLLM=Mistral-7B2026.04 | 0.6685 | — | 70.65 | — | — | — | — | — | — | — | — | — | |
| LN-EntropyLLM=Llama2-7B2026.04 | 0.6678 | — | 65.44 | — | — | — | — | — | — | — | — | — | |
| SelfCheckGPTLLM=Llama2-7B2026.04 | 0.667 | — | 65.91 | — | — | — | — | — | — | — | — | — | |
| Semantic EntropyLLM=Qwen2-7B2026.04 | 0.6634 | — | 68.08 | — | — | — | — | — | — | — | — | — | |
| EntailmentModel=Llama-3-8B, Scorer Family=BB2026.06 | 0.656 | — | — | — | — | — | — | — | — | — | — | — | |
| SelfCheckGPTLLM=Qwen2-7B2026.04 | 0.6538 | — | 63.27 | — | — | — | — | — | — | — | — | — | |
| SEModel=Llama-2-13B2025.08 | 0.6434 | — | — | 41.5 | — | — | — | — | — | — | — | — | |
| P(True)Model=Llama-3-8B, Scorer Family=WB2026.06 | 0.638 | — | — | — | — | — | — | — | — | — | — | — | |
| SEModel=Llama-3.1-8B2025.08 | 0.6224 | — | — | 36.88 | — | — | — | — | — | — | — | — | |
| FEPoIDModel=LlaMA-3.1-8B-Instruct, w=7, FST=false2026.05 | 0.6165 | — | — | — | — | — | — | — | — | — | — | — | |
| RankMeModel=LlaMA-3.1-8B-Instruct, w=7, FST=false2026.05 | 0.6075 | — | — | — | — | — | — | — | — | — | — | — | |
| IDModel=LlaMA-3.1-8B-Instruct, w=7, FST=false2026.05 | 0.6075 | — | — | — | — | — | — | — | — | — | — | — | |
| SEModel=Mistral-7B2025.08 | 0.6069 | — | — | 35.68 | — | — | — | — | — | — | — | — | |
| Val LossModel=LlaMA-3.1-8B-Instruct, w=7, FST=false2026.05 | 0.5961 | — | — | — | — | — | — | — | — | — | — | — | |
| EigenScoreLLM=Llama2-7B2026.04 | 0.596 | — | 58.8 | — | — | — | — | — | — | — | — | — | |
| EigenScoreLLM=Mistral-7B2026.04 | 0.595 | — | 56.59 | — | — | — | — | — | — | — | — | — | |
| P(True)Model=GPT-4o, Scorer Family=WB2026.06 | 0.582 | — | — | — | — | — | — | — | — | — | — | — | |
| DoLaBackbone=Llama-3.3-70B2026.05 | 0.58 | — | — | — | — | — | — | — | — | — | — | — |