Hallucination Detection on Math
81.57Mean AUROCSpikeScore
Evaluation Results
| Method | Links | |
|---|---|---|
| SpikeScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 81.57 | |
| SpikeScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 80.04 | |
| SpikeScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 76.99 | |
| ICR ProbeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 76.15 | |
| SpikeScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 75.04 | |
| ICR ProbeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 74.87 | |
| ICR ProbeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 74.34 | |
| ICR ProbeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 72.81 | |
| TDGNetSource=Math, Zero-shot=true, Base Model=LLaDA2026.02 | 72 | |
| TSVModel=LLaDA-8B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 72 | |
| TDGNetModel=LLaDA-8B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 72 | |
| TDGNetModel=Dream-7B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 72 | |
| Lexical SimilarityModel=Dream-7B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 71 | |
| EigenScoreLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 70.43 | |
| InterrogateLLMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 70.41 | |
| LN-EntropyModel=LLaDA-8B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 70 | |
| EigenScoreLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 69.95 | |
| Lexical SimilarityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 69.46 | |
| InterrogateLLMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 68.52 | |
| Semantic EntropyLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 68.12 | |
| Semantic EntropyModel=LLaDA-8B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 68 | |
| EigenScoreModel=Dream-7B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=false2026.02 | 68 | |
| TSVModel=Dream-7B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 68 | |
| Semantic EntropyLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 67.85 | |
| InterrogateLLMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 67.71 | |
| EigenScoreLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 67.53 | |
| PerplexityModel=LLaDA-8B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 67 | |
| Lexical SimilarityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 66.25 | |
| InterrogateLLMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 65.31 | |
| PRISMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 65.16 | |
| EigenScoreLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 65.15 | |
| Semantic EntropyLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 64.81 | |
| PRISMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 64.75 | |
| PerplexityLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 64.48 | |
| PRISMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 64.27 | |
| Lexical SimilarityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 64.22 | |
| PerplexityLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 63.43 | |
| Lexical SimilarityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 63.33 | |
| Semantic EntropyLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 63.07 | |
| PerplexityLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 61.26 | |
| TDGNetSource=Hotpot, Zero-shot=true, Base Model=LLaDA2026.02 | 61 | |
| SAPLMALLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 60.63 | |
| PRISMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 60.51 | |
| SAPLMALLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 60.03 | |
| PerplexityLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 59.76 | |
| MMLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 59.58 | |
| CCSSource=Math, Zero-shot=true, Base Model=LLaDA2026.02 | 59 | |
| CCSModel=LLaDA-8B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 59 | |
| Semantic EntropyModel=Dream-7B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 59 | |
| CCSModel=Dream-7B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=true2026.02 | 59 | |
| SAPLMALLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 58.61 | |
| MMLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 58.41 | |
| MMLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 57.89 | |
| MMLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 57.67 | |
| TDGNetSource=Trivia, Zero-shot=true, Base Model=LLaDA2026.02 | 57 | |
| LN-EntropyModel=Dream-7B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 57 | |
| SAPLMALLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 56.85 | |
| EigenScoreModel=LLaDA-8B-Instruct, Approach Category=Latent-Based, SS (Single Sampling)=false2026.02 | 56 | |
| SEPLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 55.5 | |
| TDGNetSource=CSQA, Zero-shot=true, Base Model=LLaDA2026.02 | 55 | |
| VerbalizeLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 54.36 | |
| SEPLLM Model=Llama-3.1-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 54.2 | |
| CCSSource=Hotpot, Zero-shot=true, Base Model=LLaDA2026.02 | 54 | |
| SEPLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 53.9 | |
| SEPLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 53.09 | |
| VerbalizeLLM Model=Qwen3-14B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 53.08 | |
| CCSSource=Trivia, Zero-shot=true, Base Model=LLaDA2026.02 | 52 | |
| PerplexityModel=Dream-7B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 52 | |
| CCSSource=CSQA, Zero-shot=true, Base Model=LLaDA2026.02 | 51 | |
| Lexical SimilarityModel=LLaDA-8B-Instruct, Approach Category=Output-Based, SS (Single Sampling)=false2026.02 | 51 | |
| VerbalizeLLM Model=Qwen3-8B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 50.9 | |
| VerbalizeLLM Model=Llama-3.2-3B, Evaluation Protocol=leave-one-out cross-domain2026.01 | 49.65 |