Hallucination Detection on Belebele
0.7719Mean AUROCSpikeScore
Evaluation Results
| Method | Links | |
|---|---|---|
| SpikeScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7719 | |
| SpikeScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7664 | |
| ICR ProbeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7498 | |
| ICR ProbeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7488 | |
| ICR ProbeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7416 | |
| ICR ProbeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7271 | |
| PRISMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7097 | |
| SpikeScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7088 | |
| PRISMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7067 | |
| EigenScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7055 | |
| EigenScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.7038 | |
| InterrogateLLMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6993 | |
| PRISMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6974 | |
| SpikeScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.696 | |
| PRISMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6887 | |
| Lexical SimilarityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6882 | |
| InterrogateLLMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6777 | |
| Semantic EntropyLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6769 | |
| EigenScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6727 | |
| Semantic EntropyLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6684 | |
| Lexical SimilarityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6632 | |
| InterrogateLLMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6611 | |
| EigenScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6515 | |
| InterrogateLLMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6449 | |
| PerplexityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6445 | |
| Lexical SimilarityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6423 | |
| Semantic EntropyLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6368 | |
| Semantic EntropyLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.632 | |
| PerplexityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6311 | |
| Lexical SimilarityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6305 | |
| PerplexityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.6153 | |
| PerplexityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5995 | |
| VerbalizeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.556 | |
| SEPLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5358 | |
| VerbalizeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5345 | |
| VerbalizeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5228 | |
| SAPLMALLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5119 | |
| VerbalizeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5077 | |
| SAPLMALLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5074 | |
| SEPLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.5004 | |
| SAPLMALLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4985 | |
| SEPLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4952 | |
| SAPLMALLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4933 | |
| SEPLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4923 | |
| MMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4893 | |
| MMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4866 | |
| MMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.4854 | |
| MMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 0.48 |