Hallucination Detection on Average Cross-domain
0.7874Mean AUROCSpikeScore
Evaluation Results
| Method | Links | |
|---|---|---|
| SpikeScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7874 | |
| SpikeScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.786 | |
| SpikeScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7474 | |
| SpikeScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7473 | |
| ICR ProbeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7463 | |
| ICR ProbeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7439 | |
| ICR ProbeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7435 | |
| ICR ProbeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7381 | |
| PRISMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7072 | |
| PRISMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7032 | |
| PRISMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7029 | |
| InterrogateLLMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.702 | |
| EigenScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6963 | |
| PRISMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6953 | |
| EigenScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.694 | |
| Lexical SimilarityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6917 | |
| InterrogateLLMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.683 | |
| Semantic EntropyLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.67 | |
| InterrogateLLMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6699 | |
| EigenScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6644 | |
| Lexical SimilarityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6636 | |
| Semantic EntropyLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6622 | |
| InterrogateLLMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6503 | |
| EigenScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.646 | |
| Lexical SimilarityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6438 | |
| PerplexityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6425 | |
| Semantic EntropyLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6357 | |
| Lexical SimilarityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6309 | |
| PerplexityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6302 | |
| Semantic EntropyLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6214 | |
| PerplexityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6111 | |
| PerplexityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5953 | |
| SAPLMALLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5787 | |
| SAPLMALLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5764 | |
| SAPLMALLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5705 | |
| SAPLMALLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5693 | |
| MMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5635 | |
| MMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5635 | |
| MMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5632 | |
| MMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5591 | |
| VerbalizeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5469 | |
| SEPLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5282 | |
| VerbalizeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5276 | |
| SEPLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5274 | |
| SEPLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.527 | |
| SEPLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5212 | |
| VerbalizeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5186 | |
| VerbalizeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.498 |