Machine Translation Error Detection on WMT MQM 2025
37.34PrecisionAIP.sec
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AIP.sec2026.03 | 37.34 | 11.99 | 18.16 | |
| AIP.pri2026.03 | 35.18 | 10.3 | 15.93 | |
| AutoLQA41.sec2026.03 | 24.42 | 5.79 | 9.3 | |
| Claude Haiku 4.52026.03 | 21.95 | 14.82 | 17.69 | |
| Claude Sonnet-4.5approach=LLM-as-a-Judge, inference_mode=zero-shot, reference_usage=reference-less2026.03 | 21.47 | 18.58 | 19.92 | |
| gpt-oss 120b2026.03 | 19.57 | 15.78 | 17.45 | |
| Qwen3 235bapproach=LLM-as-a-Judge, inference_mode=zero-shot, reference_usage=reference-less2026.03 | 17.36 | 31.45 | 22.37 | |
| GemSpanEval.pribackbone=Gemma-3 27b, inference_mode=fine-tuned, reference_usage=reference-based2026.03 | 16.6 | 25.34 | 19.84 | |
| AutoLQAESA.sec2026.03 | 16.46 | 13 | 14.01 | |
| XCOMET-XXL.bas2026.03 | 16.38 | 21.39 | 18.33 | |
| GemSpanEval-QE.secbackbone=Gemma-3 27b, inference_mode=fine-tuned, reference_usage=reference-less (QE)2026.03 | 16.33 | 28.61 | 20.6 | |
| AutoLQA.pri2026.03 | 16 | 14.99 | 14.95 | |
| XCOMET-XL.bas2026.03 | 15.46 | 21.1 | 17.47 |