Hallucination Detection on CoQA (AUROC)
90.07AUROCHCPD
Evaluation Results
| Method | Links | |
|---|---|---|
| HCPDModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 90.07 | |
| CurvatureLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 84.92 | |
| HCPDModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 84.8 | |
| FEPoIDLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 84.66 | |
| Val LossLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 82.83 | |
| IDLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 82.83 | |
| PerplexityModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 81.41 | |
| SAPLMAModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 80.28 | |
| Lexical SimilarityModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 77.53 | |
| RankMELLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 77.43 | |
| Semantic EntropyModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 75.26 | |
| TADModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 74.86 | |
| SNRLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 74.75 | |
| LN-EntropyModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 74.52 | |
| Val LossBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 73.91 | |
| IDBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 73.91 | |
| FEPoIDBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 73.91 | |
| HaloScopeModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 72.11 | |
| Pred. EntropyLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=72026.05 | 72 | |
| SAPLMAModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 71.58 | |
| CurvatureBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 71.23 | |
| EigenScoreLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Token Position=last generated token2026.05 | 70.92 | |
| RGNLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 70.9 | |
| Lexical SimilarityLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=72026.05 | 70.71 | |
| SelfCKGPTModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 70.61 | |
| Semantic EntropyModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 70.59 | |
| TSVModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 69.31 | |
| CCSModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 68.98 | |
| Val LossBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 68.6 | |
| TSVModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 68.4 | |
| Lexical SimilarityLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=72026.05 | 67.8 | |
| SelfCKGPTModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 67.57 | |
| IDBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 67.09 | |
| FEPoIDBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 67.09 | |
| Val LossLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 67.05 | |
| IDLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 67.05 | |
| FEPoIDLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 67.05 | |
| CurvatureBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 66.99 | |
| TADModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 66.94 | |
| RankMELLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 65.98 | |
| LN-Pred. EntropyLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=72026.05 | 65.28 | |
| RGNBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 63.69 | |
| CurvatureLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 63.23 | |
| Self-evaluationModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 62.51 | |
| SNRBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 62.26 | |
| HaloScopeModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 62.18 | |
| RGNLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 59.93 | |
| RankMEBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 59.81 | |
| Lexical SimilarityModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 59.13 | |
| Pred. EntropyLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=72026.05 | 58.33 | |
| LN-Pred. EntropyLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=72026.05 | 57.81 | |
| RGNBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 57.77 | |
| Semantic EntropyLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=72026.05 | 57.69 | |
| Self-evaluationModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 57.01 | |
| RankMEBackbone=LlaMA-3.2-1B, Forward horizon (w)=3, FST extraction status=without FST2026.05 | 56.21 | |
| CCSModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 55.1 | |
| LN-EntropyModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 54.28 | |
| PerplexityModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 54.06 | |
| EigenScoreModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 52.79 | |
| LIDLLM Backbone=Mistral-7B-Instruct-v0.3, Window size (w)=7, Token Position=last generated token2026.05 | 52.74 | |
| EigenScoreLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Token Position=last generated token2026.05 | 52.47 | |
| SNRLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Method Category=Hidden-State Probing, Token Position=last generated token2026.05 | 52.4 | |
| EigenScoreModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 52 | |
| SNRBackbone=LlaMA-3.2-3B, Forward horizon (w)=7, FST extraction status=without FST2026.05 | 51.16 | |
| LIDLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=7, Token Position=last generated token2026.05 | 50.59 | |
| Semantic EntropyLLM Backbone=LlaMA-3.1-8B-Instruct, Window size (w)=72026.05 | 50.03 | |
| Val LossBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8621 | |
| IDBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8581 | |
| FEPoIDBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8581 | |
| CurvatureBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8557 | |
| FEPoIDBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8501 | |
| CurvatureBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8474 | |
| IDBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8474 | |
| Val LossBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.843 | |
| RGNBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8346 | |
| RankMEBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.8159 | |
| EmbRegressModel=gpt-4o-mini-2024-07-18, Category=Multi-trajectory / LLM-based2026.05 | 0.792 | |
| Lexical SimilarityBackbone=LLaMA-3-8B-Instruct2026.05 | 0.7903 | |
| Lexical SimilarityBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7902 | |
| RankMEBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7746 | |
| SelfCKGPTBackbone=LLaMA-3-8B-Instruct2026.05 | 0.7641 | |
| SNRBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7602 | |
| FLaG (Full)Backbone=LLaMA-3-8B-Instruct2026.05 | 0.7532 | |
| Probe-LRBackbone=LLaMA-3-8B-Instruct2026.05 | 0.7495 | |
| SNRBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7453 | |
| SelfCKGPTBackbone=Qwen2.5-7B-Instruct2026.05 | 0.7443 | |
| Pred. EntropyBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7396 | |
| KLEModel=Meta-Llama-3-8B-Instruct, Category=Multi-trajectory / LLM-based2026.05 | 0.739 | |
| EigenScoreBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7362 | |
| SAPLMABackbone=LLaMA-3-8B-Instruct2026.05 | 0.7333 | |
| EigenScoreBackbone=Qwen2.5-7B-Instruct2026.05 | 0.7315 | |
| Pred. EntropyBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.73 | |
| EmbRegressModel=Meta-Llama-3-8B-Instruct, Category=Multi-trajectory / LLM-based2026.05 | 0.729 | |
| FLaG (Full)Backbone=Qwen2.5-7B-Instruct2026.05 | 0.7264 | |
| EigenScoreBackbone=LLaMA-3-8B-Instruct2026.05 | 0.7259 | |
| EGHBackbone=Qwen2.5-7B-Instruct2026.05 | 0.7206 | |
| RGNBackbone=LLaMA-3.1-8B-Instruct, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7167 | |
| SAPLMABackbone=Qwen2.5-7B-Instruct2026.05 | 0.7124 | |
| EigenScoreBackbone=Mistral-7B-Instruct-v0.3, First-sentence truncation=true, Forward horizon (w)=72026.05 | 0.7087 | |
| TTPDBackbone=LLaMA-3-8B-Instruct2026.05 | 0.7086 |