Hallucination Detection on QA (ROC-AUC)
75.3ROC-AUCSimple Focus
Evaluation Results
| Method | Links | |
|---|---|---|
| Simple FocusLLM Model=Gemma-2 9B2025.05 | 75.3 | |
| RAUQLLM Model=Gemma-2 9B2025.05 | 75.2 | |
| FocusLLM Model=Gemma-2 9B2025.05 | 74.7 | |
| MSPLLM Model=Gemma-2 9B2025.05 | 74.6 | |
| PerplexityLLM Model=Gemma-2 9B2025.05 | 73.5 | |
| CCPLLM Model=Gemma-2 9B2025.05 | 72.9 | |
| RAUQLLM Model=Falcon-3 10B2025.05 | 72.6 | |
| RAUQLLM Model=Llama-3.1 8B2025.05 | 72.4 | |
| Simple FocusLLM Model=Falcon-3 10B2025.05 | 72.4 | |
| SARLLM Model=Gemma-2 9B2025.05 | 72.3 | |
| MSPLLM Model=Falcon-3 10B2025.05 | 72.1 | |
| Semantic DensityLLM Model=Falcon-3 10B2025.05 | 72.1 | |
| Simple FocusLLM Model=Llama-3.1 8B2025.05 | 71.8 | |
| PerplexityLLM Model=Falcon-3 10B2025.05 | 71.3 | |
| SARLLM Model=Falcon-3 10B2025.05 | 71.2 | |
| MSPLLM Model=Llama-3.1 8B2025.05 | 71.1 | |
| Semantic DensityLLM Model=Gemma-2 9B2025.05 | 71.1 | |
| SARLLM Model=Qwen-2.5 7B2025.05 | 70.8 | |
| Semantic EntropyLLM Model=Falcon-3 10B2025.05 | 70.6 | |
| PerplexityLLM Model=Qwen-2.5 7B2025.05 | 70.5 | |
| Semantic DensityLLM Model=Qwen-2.5 7B2025.05 | 70.5 | |
| RAUQLLM Model=Qwen-2.5 7B2025.05 | 70.5 | |
| Simple FocusLLM Model=Qwen-2.5 7B2025.05 | 70.3 | |
| CCPLLM Model=Falcon-3 10B2025.05 | 70.3 | |
| EVL NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 70.3 | |
| PerplexityLLM Model=Llama-3.1 8B2025.05 | 70.1 | |
| MSPLLM Model=Qwen-2.5 7B2025.05 | 70 | |
| DegMat NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 70 | |
| FocusLLM Model=Falcon-3 10B2025.05 | 69.9 | |
| FocusLLM Model=Llama-3.1 8B2025.05 | 69.8 | |
| SARLLM Model=Llama-3.1 8B2025.05 | 69.6 | |
| Semantic DensityLLM Model=Llama-3.1 8B2025.05 | 69.4 | |
| DegMat NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 69.2 | |
| DegMat NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 69.1 | |
| EVL NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 69 | |
| LUQLLM Model=Gemma-2 9B2025.05 | 69 | |
| EVL NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 68.8 | |
| LUQLLM Model=Qwen-2.5 7B2025.05 | 68.8 | |
| Ecc. NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 68.8 | |
| Lexical Similarity Rouge-LLLM Model=Qwen-2.5 7B2025.05 | 68.7 | |
| LUQLLM Model=Falcon-3 10B2025.05 | 68.7 | |
| CCPLLM Model=Llama-3.1 8B2025.05 | 68.5 | |
| Lexical Similarity Rouge-LLLM Model=Gemma-2 9B2025.05 | 68.4 | |
| Semantic EntropyLLM Model=Gemma-2 9B2025.05 | 68.3 | |
| Ecc. NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 68.2 | |
| Semantic EntropyLLM Model=Qwen-2.5 7B2025.05 | 68 | |
| Ecc. NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 67.8 | |
| DegMat NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 67.6 | |
| EigenScoreLLM Model=Qwen-2.5 7B2025.05 | 67.5 | |
| Lexical Similarity Rouge-LLLM Model=Falcon-3 10B2025.05 | 67.3 | |
| EVL NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 66.8 | |
| CCPLLM Model=Qwen-2.5 7B2025.05 | 66.8 | |
| LUQLLM Model=Llama-3.1 8B2025.05 | 66.7 | |
| EigenScoreLLM Model=Falcon-3 10B2025.05 | 66.2 | |
| Semantic EntropyLLM Model=Llama-3.1 8B2025.05 | 66.1 | |
| Ecc. NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 65.9 | |
| Lexical Similarity Rouge-LLLM Model=Llama-3.1 8B2025.05 | 65.9 | |
| EigenScoreLLM Model=Gemma-2 9B2025.05 | 65.8 | |
| EigenScoreLLM Model=Llama-3.1 8B2025.05 | 64.3 | |
| FocusLLM Model=Qwen-2.5 7B2025.05 | 64.2 | |
| Attention ScoreLLM Model=Falcon-3 10B2025.05 | 53.4 | |
| Attention ScoreLLM Model=Qwen-2.5 7B2025.05 | 52.2 | |
| Attention ScoreLLM Model=Gemma-2 9B2025.05 | 51.9 | |
| Attention ScoreLLM Model=Llama-3.1 8B2025.05 | 49.7 |