Span-level Machine Translation Error Detection on WMT MQM EN-DE 2023 (test)
39.02PrecisionMQM #2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MQM #2type=human evaluator2026.03 | 39.02 | 37.47 | 38.23 | |
| Sonnet 4.5version=4.52026.03 | 38.92 | 27.8 | 32.44 | |
| MQM #1type=human evaluator2026.03 | 38.04 | 35.51 | 36.73 | |
| Haiku 4.5version=4.52026.03 | 37.79 | 18.54 | 24.87 | |
| gpt-oss 120bparameters=120b2026.03 | 32.33 | 24.6 | 27.94 | |
| Qwen3 235bparameters=235b2026.03 | 31.18 | 30.41 | 30.79 |