Hallucination Detection on Machine Translation
53.2PRRMTE
Evaluation Results
| Method | Links | |
|---|---|---|
| MTELLM Model=GPT-OSS 20B2025.05 | 53.2 | |
| RAUQLLM Model=GPT-OSS 20B2025.05 | 52.5 | |
| RAUQLLM Model=Llama-3.1 8B-Instruct2025.05 | 50.5 | |
| SARLLM Model=GPT-OSS 20B2025.05 | 48.1 | |
| MTELLM Model=Llama-3.1 8B-Instruct2025.05 | 47.8 | |
| PerplexityLLM Model=GPT-OSS 20B2025.05 | 47.1 | |
| SARLLM Model=Llama-3.1 8B-Instruct2025.05 | 46.7 | |
| Semantic EntropyLLM Model=GPT-OSS 20B2025.05 | 43.7 | |
| EigenScoreLLM Model=Llama-3.1 8B-Instruct2025.05 | 43.7 | |
| Simple FocusLLM Model=GPT-OSS 20B2025.05 | 42.7 | |
| MSPLLM Model=GPT-OSS 20B2025.05 | 42.2 | |
| PerplexityLLM Model=Llama-3.1 8B-Instruct2025.05 | 42.2 | |
| Lexical Similarity Rouge-LLLM Model=GPT-OSS 20B2025.05 | 41.8 | |
| Semantic EntropyLLM Model=Llama-3.1 8B-Instruct2025.05 | 41.6 | |
| Lexical Similarity Rouge-LLLM Model=Llama-3.1 8B-Instruct2025.05 | 39.9 | |
| EigenScoreLLM Model=GPT-OSS 20B2025.05 | 39.1 | |
| Ecc. NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 38.4 | |
| MSPLLM Model=Llama-3.1 8B-Instruct2025.05 | 38.3 | |
| Ecc. NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 37.7 | |
| EVL NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 37.4 | |
| Simple FocusLLM Model=Llama-3.1 8B-Instruct2025.05 | 37.4 | |
| DegMat NLI Score entail.LLM Model=GPT-OSS 20B2025.05 | 37.2 | |
| Semantic DensityLLM Model=Llama-3.1 8B-Instruct2025.05 | 36 | |
| Semantic DensityLLM Model=GPT-OSS 20B2025.05 | 35.9 | |
| EVL NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 35.7 | |
| DegMat NLI Score entail.LLM Model=Llama-3.1 8B-Instruct2025.05 | 35.6 | |
| CCPLLM Model=GPT-OSS 20B2025.05 | 34.7 | |
| CCPLLM Model=Llama-3.1 8B-Instruct2025.05 | 34.1 | |
| LUQLLM Model=Llama-3.1 8B-Instruct2025.05 | 30.6 | |
| LUQLLM Model=GPT-OSS 20B2025.05 | 24.4 | |
| Attention ScoreLLM Model=GPT-OSS 20B2025.05 | 14.9 | |
| Attention ScoreLLM Model=Llama-3.1 8B-Instruct2025.05 | 13.7 |