Machine Translation Evaluation on WMT MQM System-level 22
91.2Overall ScoreEAPrompt
Evaluation Results
| Method | Links | |
|---|---|---|
| EAPromptBackbone=GPT-3.5-Turbo, Reference provided=true2023.03 | 91.2 | |
| EAPromptBackbone=GPT-3.5-Turbo, Reference provided=false2023.03 | 89.4 | |
| GEMBABackbone=GPT-3.5-Turbo, Reference provided=false2023.03 | 86.9 | |
| GEMBABackbone=GPT-3.5-Turbo, Reference provided=true2023.03 | 86.5 | |
| EAPromptBackbone=Llama2-70b-Chat, Reference provided=false2023.03 | 85.8 | |
| EAPromptBackbone=Llama2-70b-Chat, Reference provided=true2023.03 | 85.4 | |
| MetricsX-XXLReference provided=true2023.03 | 85 | |
| BLEURT20Reference provided=true2023.03 | 84.7 | |
| EAPromptBackbone=Mixtral-8x7b-Instruct, Reference provided=true2023.03 | 84 | |
| COMET22Reference provided=true2023.03 | 83.9 | |
| UniTEReference provided=true2023.03 | 82.8 | |
| EAPromptBackbone=Mixtral-8x7b-Instruct, Reference provided=false2023.03 | 82.5 | |
| COMET-QEReference provided=false2023.03 | 78.1 | |
| UniTE-srcReference provided=false2023.03 | 75.9 | |
| MaTESe-QEReference provided=false2023.03 | 74.8 | |
| GEMBABackbone=Llama2-70b-Chat, Reference provided=true2023.03 | 74.1 | |
| GEMBABackbone=Mixtral-8x7b-Instruct, Reference provided=false2023.03 | 74.1 | |
| GEMBABackbone=Llama2-70b-Chat, Reference provided=false2023.03 | 72.6 | |
| GEMBABackbone=Mixtral-8x7b-Instruct, Reference provided=true2023.03 | 69.7 |