Machine Translation Evaluation on WMT MQM Segment-level 22
60.1Score (En-De)MetricsX-XXL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MetricsX-XXLReference provided=true2023.03 | 60.1 | 60.6 | 51.1 | |
| UniTEReference provided=true2023.03 | 59.8 | 57.7 | 51.7 | |
| COMET22Reference provided=true2023.03 | 59.4 | 57.7 | 53.6 | |
| UniTE-srcReference provided=false2023.03 | 58.2 | 55.4 | 50.8 | |
| MaTESe-QEReference provided=false2023.03 | 57.2 | 49.9 | 49.4 | |
| BLEURT20Reference provided=true2023.03 | 56.8 | 54 | 48.9 | |
| EAPromptBackbone=GPT-3.5-Turbo, Reference provided=true2023.03 | 56.7 | 53.3 | 50 | |
| EAPromptBackbone=GPT-3.5-Turbo, Reference provided=false2023.03 | 55.7 | 53.4 | 48.8 | |
| COMET-QEReference provided=false2023.03 | 55.5 | 53.4 | 48.3 | |
| EAPromptBackbone=Llama2-70b-Chat, Reference provided=true2023.03 | 55.2 | 51.4 | 50.2 | |
| GEMBABackbone=GPT-3.5-Turbo, Reference provided=true2023.03 | 55.2 | 49.5 | 48.2 | |
| EAPromptBackbone=Llama2-70b-Chat, Reference provided=false2023.03 | 55 | 51.6 | 49.3 | |
| GEMBABackbone=Mixtral-8x7b-Instruct, Reference provided=true2023.03 | 54.8 | 48.3 | 46.7 | |
| GEMBABackbone=Mixtral-8x7b-Instruct, Reference provided=false2023.03 | 54.8 | 47.5 | 46.2 | |
| GEMBABackbone=GPT-3.5-Turbo, Reference provided=false2023.03 | 54.7 | 50 | 47.6 | |
| GEMBABackbone=Llama2-70b-Chat, Reference provided=false2023.03 | 54.1 | 47.8 | 45 | |
| EAPromptBackbone=Mixtral-8x7b-Instruct, Reference provided=false2023.03 | 54.1 | 49.9 | 48.3 | |
| EAPromptBackbone=Mixtral-8x7b-Instruct, Reference provided=true2023.03 | 53.8 | 50.6 | 48.2 | |
| GEMBABackbone=Llama2-70b-Chat, Reference provided=true2023.03 | 53.7 | 48.8 | 45.4 |