Hallucination Detection on CoQA
0.8584Mean AUROCSpikeScore
Evaluation Results
| Method | Links | |
|---|---|---|
| SpikeScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8584 | |
| SpikeScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.854 | |
| SpikeScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8333 | |
| LN-EntropyBackbone=Mistral-7B2026.03 | 0.83 | |
| Adaptive Bayesian EstimationLLM=Mistral-Small-24B, Sampling budget (N)=52026.03 | 0.825 | |
| SpikeScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8205 | |
| INTRYGUEmeanBackbone=Mistral-7B2026.03 | 0.82 | |
| ICR ProbeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8155 | |
| PRISMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8116 | |
| INTRYGUEmeanBackbone=Llama-2-13B2026.03 | 0.81 | |
| INTRYGUEmeanBackbone=Llama-3.1-8B2026.03 | 0.81 | |
| ICR ProbeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8084 | |
| ICR ProbeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8074 | |
| ICR ProbeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.8 | |
| INTRYGUEmeanBackbone=Qwen3-8B2026.03 | 0.8 | |
| Adaptive Bayesian EstimationLLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.799 | |
| PRISMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7984 | |
| PRISMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7917 | |
| INTRYGUEmin-maxBackbone=Mistral-7B2026.03 | 0.79 | |
| INTRYGUEmeanBackbone=Llama-2-7B2026.03 | 0.79 | |
| Semantic EntropyBackbone=Mistral-7B2026.03 | 0.79 | |
| PRISMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7891 | |
| INTRYGUEmin-maxBackbone=Llama-3.1-8B2026.03 | 0.78 | |
| MaxEntropyBackbone=Mistral-7B2026.03 | 0.78 | |
| INTRYGUEmin-maxBackbone=Qwen3-8B2026.03 | 0.77 | |
| SESDLGLLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.769 | |
| SESDLGLLM=Mistral-Small-24B, Sampling budget (N)=52026.03 | 0.765 | |
| Adaptive Bayesian EstimationLLM=Mistral-Small-24B, Sampling budget (N)=22026.03 | 0.762 | |
| INTRYGUEmin-maxBackbone=Llama-2-7B2026.03 | 0.76 | |
| INTRYGUEmeanBackbone=gemma-3-4b2026.03 | 0.76 | |
| SELLM=Mistral-Small-24B, Sampling budget (N)=52026.03 | 0.758 | |
| SELLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.756 | |
| Val LossBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.7552 | |
| Adaptive Bayesian EstimationLLM=Llama-2-7B, Sampling budget (N)=52026.03 | 0.748 | |
| IDBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.7468 | |
| FEPoIDBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.7468 | |
| Adaptive Bayesian EstimationLLM=Llama-3.1-8B, Sampling budget (N)=22026.03 | 0.738 | |
| INTRYGUEmin-maxBackbone=gemma-3-4b2026.03 | 0.73 | |
| INTRYGUEmin-maxBackbone=Llama-2-13B2026.03 | 0.72 | |
| LSCBackbone=Mistral-7B2026.03 | 0.72 | |
| MaxProbBackbone=Mistral-7B2026.03 | 0.72 | |
| SARBackbone=Mistral-7B2026.03 | 0.72 | |
| CurvatureBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.7187 | |
| InterrogateLLMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7013 | |
| SELLM=Llama-3.1-8B, Sampling budget (N)=22026.03 | 0.699 | |
| RankMEBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.6972 | |
| Adaptive Bayesian EstimationLLM=Llama-2-7B, Sampling budget (N)=22026.03 | 0.695 | |
| EigenScoreBackbone=Mistral-7B2026.03 | 0.69 | |
| SESDLGLLM=Llama-2-7B, Sampling budget (N)=52026.03 | 0.688 | |
| EigenScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6876 | |
| RGNBackbone=LlaMA-3.1-8B base, Forward horizon (w)=7, FST=false2026.05 | 0.6859 | |
| SELLM=Llama-2-7B, Sampling budget (N)=52026.03 | 0.683 | |
| EigenScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6809 | |
| Lexical SimilarityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.679 | |
| InterrogateLLMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6787 | |
| InterrogateLLMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6761 | |
| SESDLGLLM=Mistral-Small-24B, Sampling budget (N)=22026.03 | 0.669 | |
| Semantic EntropyLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6615 | |
| SARLLM=Mistral-Small-24B, Sampling budget (N)=52026.03 | 0.66 | |
| SELLM=Mistral-Small-24B, Sampling budget (N)=22026.03 | 0.658 | |
| Lexical SimilarityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6571 | |
| SARLLM=Llama-3.1-8B, Sampling budget (N)=22026.03 | 0.655 | |
| EigenScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6538 | |
| Semantic EntropyLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6532 | |
| SESDLGLLM=Llama-3.1-8B, Sampling budget (N)=22026.03 | 0.648 | |
| SARLLM=Llama-3.1-8B, Sampling budget (N)=52026.03 | 0.648 | |
| SAPLMALLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6468 | |
| InterrogateLLMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6456 | |
| SARLLM=Mistral-Small-24B, Sampling budget (N)=22026.03 | 0.643 | |
| PerplexityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.642 | |
| EigenScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6417 | |
| Lexical SimilarityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6397 | |
| SAPLMALLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6392 | |
| SAPLMALLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6358 | |
| Semantic EntropyLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6302 | |
| SAPLMALLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6301 | |
| PerplexityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6284 | |
| SARLLM=Llama-2-7B, Sampling budget (N)=52026.03 | 0.627 | |
| Lexical SimilarityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6254 | |
| ReDeEPBackbone=Mistral-7B2026.03 | 0.62 | |
| SESDLGLLM=Llama-2-7B, Sampling budget (N)=22026.03 | 0.618 | |
| P(True)LLM=Mistral-Small-24B2026.03 | 0.618 | |
| MMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6161 | |
| Semantic EntropyLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6133 | |
| MMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.612 | |
| Semantic DensityBackbone=Mistral-7B2026.03 | 0.61 | |
| PerplexityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.609 | |
| SELLM=Llama-2-7B, Sampling budget (N)=22026.03 | 0.609 | |
| MMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6037 | |
| PerplexityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5962 | |
| MMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5948 | |
| SARLLM=Llama-2-7B, Sampling budget (N)=22026.03 | 0.591 | |
| PerplexityBackbone=Mistral-7B2026.03 | 0.59 | |
| P(True)LLM=Llama-3.1-8B2026.03 | 0.568 | |
| Attention ScoreBackbone=Mistral-7B2026.03 | 0.55 | |
| VerbalizeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.54 | |
| FocusBackbone=Mistral-7B2026.03 | 0.53 | |
| SEPLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5275 | |
| SEPLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5221 | |
| VerbalizeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5172 |