Span-level Machine Translation Error Detection on WMT MQM (ZH-EN) 2023 (test)
50.25PrecisionHaiku 4.5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Haiku 4.5version=4.52026.03 | 50.25 | 25.66 | 33.97 | |
| Sonnet 4.5version=4.52026.03 | 48.82 | 33.94 | 40.04 | |
| MQM #2type=human evaluator2026.03 | 44.57 | 39.82 | 42.06 | |
| gpt-oss 120bparameters=120b2026.03 | 44.55 | 29.1 | 35.2 | |
| MQM #1type=human evaluator2026.03 | 40.17 | 39.48 | 39.82 | |
| Qwen3 235bparameters=235b2026.03 | 40.12 | 39.5 | 39.81 |