Performance Prediction on WMT Average WMT'14 & WMT'19 (aggregation)
0.29MAELLM-PP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-PPBackbone=GPT-42023.10 | 0.29 | 0.68 | |
| LLM-PPBackbone=GPT-4, Ablation=+ Fifth instruction2023.10 | 0.29 | 0.68 | |
| LLM-PPBackbone=GPT-4, Ablation=+ Role + Hyp.2023.10 | 0.3 | 0.64 | |
| LLM-PPBackbone=GPT-4, Ablation=+ Fourth instruction2023.10 | 0.3 | 0.66 | |
| LLM-PPBackbone=GPT-4, Ablation=+ First instruction2023.10 | 0.31 | 0.62 | |
| LLM-PPBackbone=GPT-4, Ablation=+ Second instruction2023.10 | 0.31 | 0.66 | |
| LLM-PPBackbone=GPT-4, Ablation=+ Third instruction2023.10 | 0.31 | 0.63 | |
| LLM-Distill-PPTeacher Backbone=GPT-42023.10 | 0.31 | 0.69 | |
| LLM-PPBackbone=GPT-4, Ablation=Demonstrations only2023.10 | 0.32 | 0.6 | |
| LLM-PPBackbone=ChatGPT2023.10 | 0.65 | 0.56 | |
| LLM-PPBackbone=Mistral2023.10 | 0.75 | 0.25 | |
| LLM-Distill-PPTeacher Backbone=ChatGPT2023.10 | 0.76 | 0.68 | |
| Neuron-wise MoSType=Baseline2023.10 | 0.97 | 0.78 | |
| Layer-wise MoSType=Baseline2023.10 | 1.03 | 0.7 | |
| Supernet (Sandwich)Type=Baseline2023.10 | 1.08 | 0.77 | |
| HATType=Baseline2023.10 | 1.21 | 0.74 |