Hallucination Detection on CommonsenseQA
0.7563Mean AUROCSpikeScore
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SpikeScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7563 | — | — | |
| Lookback LensModel=Qwen-3-14B2026.04 | 0.7501 | 75.25 | 44.15 | |
| SpikeScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7451 | — | — | |
| SpikeScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7411 | — | — | |
| SATMD + MSPModel=Qwen-3-14B2026.04 | 0.7262 | 83.54 | 46.92 | |
| ICR ProbeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7249 | — | — | |
| ICR ProbeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7205 | — | — | |
| PRISMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7187 | — | — | |
| ICR ProbeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7186 | — | — | |
| ICR ProbeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7118 | — | — | |
| PRISMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7075 | — | — | |
| PRISMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7051 | — | — | |
| SIVRModel=Qwen-3-14B2026.04 | 0.7032 | 61.18 | 25.98 | |
| InterrogateLLMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.703 | — | — | |
| PRISMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6988 | — | — | |
| SpikeScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6947 | — | — | |
| Lexical SimilarityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6911 | — | — | |
| EigenScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6895 | — | — | |
| EigenScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6864 | — | — | |
| InterrogateLLMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6814 | — | — | |
| EntropyModel=Qwen-3-14B2026.04 | 0.6767 | 83.25 | 32.6 | |
| EnergyModel=Qwen-3-14B2026.04 | 0.6755 | 84.24 | 33.68 | |
| Semantic EntropyLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6725 | — | — | |
| InterrogateLLMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.667 | — | — | |
| Semantic EntropyLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6664 | — | — | |
| PerplexityModel=Qwen-3-14B2026.04 | 0.6662 | 87.93 | 32.09 | |
| Max ProbModel=Qwen-3-14B2026.04 | 0.6653 | 88.18 | 32.25 | |
| Lexical SimilarityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6626 | — | — | |
| EigenScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.656 | — | — | |
| Temp-ScaledModel=Qwen-3-14B2026.04 | 0.6545 | 91.87 | 30.86 | |
| InterrogateLLMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6528 | — | — | |
| SAPLMAModel=Qwen-3-14B2026.04 | 0.6509 | 70.73 | 22.41 | |
| Lexical SimilarityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6402 | — | — | |
| Semantic EntropyLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6385 | — | — | |
| PerplexityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6379 | — | — | |
| EigenScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6378 | — | — | |
| PerplexityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6287 | — | — | |
| Lexical SimilarityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6283 | — | — | |
| Semantic EntropyLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.625 | — | — | |
| PerplexityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6108 | — | — | |
| PerplexityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5893 | — | — | |
| SEModel=Qwen-3-14B2026.04 | 0.574 | 89.74 | 28.41 | |
| VerbalizeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5476 | — | — | |
| MMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5468 | — | — | |
| MMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5411 | — | — | |
| MMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5384 | — | — | |
| SAPLMALLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5319 | — | — | |
| MMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5309 | — | — | |
| SAPLMALLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5281 | — | — | |
| VerbalizeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5232 | — | — | |
| VerbalizeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5226 | — | — | |
| SAPLMALLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5217 | — | — | |
| SEPLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.517 | — | — | |
| SEPLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5164 | — | — | |
| SAPLMALLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5163 | — | — | |
| SEPLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5157 | — | — | |
| SEPLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5102 | — | — | |
| SARModel=Qwen-3-14B2026.04 | 0.5082 | 89.74 | 22.15 | |
| VerbalizeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.499 | — | — | |
| CoE-CModel=Qwen-3-14B2026.04 | 0.4779 | 96.06 | 17.82 | |
| CoE-RModel=Qwen-3-14B2026.04 | 0.4484 | 96.31 | 16.64 | |
| P(True)Model=Qwen-3-14B2026.04 | 0.4395 | 98.03 | 15.01 |