Hallucination Detection on MT
72.7ROC-AUCRAUQ
Evaluation Results
| Method | Links | |
|---|---|---|
| RAUQLLM Model=Falcon-3 10B2025.05 | 72.7 | |
| RAUQLLM Model=Gemma-2 9B2025.05 | 71.8 | |
| RAUQLLM Model=Qwen-2.5 7B2025.05 | 71.5 | |
| PerplexityLLM Model=Falcon-3 10B2025.05 | 71.5 | |
| RAUQLLM Model=Llama-3.1 8B2025.05 | 71.3 | |
| PerplexityLLM Model=Qwen-2.5 7B2025.05 | 71.3 | |
| SARLLM Model=Qwen-2.5 7B2025.05 | 71 | |
| SARLLM Model=Gemma-2 9B2025.05 | 71 | |
| Simple FocusLLM Model=Gemma-2 9B2025.05 | 70.6 | |
| Simple FocusLLM Model=Qwen-2.5 7B2025.05 | 70 | |
| PerplexityLLM Model=Gemma-2 9B2025.05 | 69.9 | |
| Simple FocusLLM Model=Llama-3.1 8B2025.05 | 69.4 | |
| SARLLM Model=Llama-3.1 8B2025.05 | 69.2 | |
| Simple FocusLLM Model=Falcon-3 10B2025.05 | 69.1 | |
| PerplexityLLM Model=Llama-3.1 8B2025.05 | 69 | |
| MSPLLM Model=Falcon-3 10B2025.05 | 68.8 | |
| MSPLLM Model=Llama-3.1 8B2025.05 | 68.6 | |
| MSPLLM Model=Qwen-2.5 7B2025.05 | 68.5 | |
| FocusLLM Model=Gemma-2 9B2025.05 | 68.4 | |
| MSPLLM Model=Gemma-2 9B2025.05 | 68.3 | |
| FocusLLM Model=Qwen-2.5 7B2025.05 | 68.2 | |
| Lexical Similarity Rouge-LLLM Model=Qwen-2.5 7B2025.05 | 67.7 | |
| FocusLLM Model=Falcon-3 10B2025.05 | 67.2 | |
| SARLLM Model=Falcon-3 10B2025.05 | 67 | |
| Lexical Similarity Rouge-LLLM Model=Gemma-2 9B2025.05 | 66.8 | |
| Semantic EntropyLLM Model=Falcon-3 10B2025.05 | 66.6 | |
| Semantic EntropyLLM Model=Qwen-2.5 7B2025.05 | 66.5 | |
| FocusLLM Model=Llama-3.1 8B2025.05 | 66.3 | |
| Semantic EntropyLLM Model=Gemma-2 9B2025.05 | 66.1 | |
| Lexical Similarity Rouge-LLLM Model=Llama-3.1 8B2025.05 | 66 | |
| Semantic EntropyLLM Model=Llama-3.1 8B2025.05 | 65.8 | |
| CCPLLM Model=Qwen-2.5 7B2025.05 | 65.8 | |
| CCPLLM Model=Falcon-3 10B2025.05 | 65.7 | |
| EigenScoreLLM Model=Qwen-2.5 7B2025.05 | 65.5 | |
| Ecc. NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 65 | |
| CCPLLM Model=Llama-3.1 8B2025.05 | 64.8 | |
| Ecc. NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 64.8 | |
| CCPLLM Model=Gemma-2 9B2025.05 | 64.6 | |
| Lexical Similarity Rouge-LLLM Model=Falcon-3 10B2025.05 | 64.6 | |
| Ecc. NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 64.2 | |
| DegMat NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 63.7 | |
| DegMat NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 63.6 | |
| Semantic DensityLLM Model=Qwen-2.5 7B2025.05 | 63.5 | |
| EVL NLI Score entail.LLM Model=Gemma-2 9B2025.05 | 63.2 | |
| Ecc. NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 63 | |
| EVL NLI Score entail.LLM Model=Qwen-2.5 7B2025.05 | 63 | |
| EigenScoreLLM Model=Llama-3.1 8B2025.05 | 62.9 | |
| LUQLLM Model=Gemma-2 9B2025.05 | 62.9 | |
| Semantic DensityLLM Model=Llama-3.1 8B2025.05 | 62.8 | |
| Semantic DensityLLM Model=Falcon-3 10B2025.05 | 62.4 | |
| EigenScoreLLM Model=Falcon-3 10B2025.05 | 62.3 | |
| DegMat NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 62 | |
| DegMat NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 61.8 | |
| LUQLLM Model=Llama-3.1 8B2025.05 | 61.8 | |
| Semantic DensityLLM Model=Gemma-2 9B2025.05 | 61.7 | |
| EigenScoreLLM Model=Gemma-2 9B2025.05 | 61.4 | |
| LUQLLM Model=Qwen-2.5 7B2025.05 | 61.3 | |
| EVL NLI Score entail.LLM Model=Falcon-3 10B2025.05 | 61.2 | |
| EVL NLI Score entail.LLM Model=Llama-3.1 8B2025.05 | 61 | |
| LUQLLM Model=Falcon-3 10B2025.05 | 59.9 | |
| Attention ScoreLLM Model=Llama-3.1 8B2025.05 | 55.3 | |
| Attention ScoreLLM Model=Gemma-2 9B2025.05 | 54.3 | |
| Attention ScoreLLM Model=Qwen-2.5 7B2025.05 | 54 | |
| Attention ScoreLLM Model=Falcon-3 10B2025.05 | 53.9 |