Hallucination Detection on QA
49PRRRAUQ
Evaluation Results
| Method | Links | |
|---|---|---|
| RAUQLLM Model=Llama-3.1 8B-Instruct2025.05 | 49 | |
| MTELLM Model=Llama-3.1 8B-Instruct2025.05 | 45.8 | |
| SARLLM Model=Llama-3.1 8B-Instruct2025.05 | 45.3 | |
| Lexical Similarity Rouge-LLLM Model=Llama-3.1 8B-Instruct2025.05 | 44.6 | |
| LUQLLM Model=Llama-3.1 8B-Instruct2025.05 | 43.2 | |
| DegMat NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 42.5 | |
| Simple FocusLLM Model=Llama-3.1 8B-Instruct2025.05 | 42.2 | |
| PerplexityLLM Model=Llama-3.1 8B-Instruct2025.05 | 41.9 | |
| EVL NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 41.5 | |
| MSPLLM Model=Llama-3.1 8B-Instruct2025.05 | 40.8 | |
| RAUQLLM Model=GPT-OSS 20B2025.05 | 40.6 | |
| SARLLM Model=GPT-OSS 20B2025.05 | 40.3 | |
| MTELLM Model=GPT-OSS 20B2025.05 | 39.9 | |
| DegMat NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 39.5 | |
| CCPLLM Model=Llama-3.1 8B-Instruct2025.05 | 39.5 | |
| Semantic EntropyLLM Model=Llama-3.1 8B-Instruct2025.05 | 39.5 | |
| LUQLLM Model=GPT-OSS 20B2025.05 | 38.9 | |
| PerplexityLLM Model=GPT-OSS 20B2025.05 | 38.8 | |
| MSPLLM Model=GPT-OSS 20B2025.05 | 38.7 | |
| EVL NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 38.3 | |
| Lexical Similarity Rouge-LLLM Model=GPT-OSS 20B2025.05 | 38.1 | |
| Simple FocusLLM Model=GPT-OSS 20B2025.05 | 38 | |
| Ecc. NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 37.8 | |
| Semantic EntropyLLM Model=GPT-OSS 20B2025.05 | 37.3 | |
| CCPLLM Model=GPT-OSS 20B2025.05 | 35.5 | |
| EigenScoreLLM Model=Llama-3.1 8B-Instruct2025.05 | 34.8 | |
| Ecc. NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 34.7 | |
| EigenScoreLLM Model=GPT-OSS 20B2025.05 | 30.5 | |
| Semantic DensityLLM Model=Llama-3.1 8B-Instruct2025.05 | 24.1 | |
| Semantic DensityLLM Model=GPT-OSS 20B2025.05 | 19.4 | |
| Attention ScoreLLM Model=GPT-OSS 20B2025.05 | 11.1 | |
| Attention ScoreLLM Model=Llama-3.1 8B-Instruct2025.05 | 8.9 |