Machine Translation on WMT14 English-French (newstest2014)
45.9BLEUDeepL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepLTraining Data=proprietary high-quality bitext2018.08 | 45.9 | — | |
| Back-Translation with samplingTraining Data=back-translation with 31M newscrawl sentences2018.08 | 45.6 | 43.8 | |
| RK2-block (learnable gamma_i)Layers=12-6, #Param=297M, Steps=100K2022.03 | 44.11 | 42.2 | |
| Transformer + RDBackbone=Transformer-Big2021.06 | 43.95 | — | |
| RK2-blockLayers=12-6, #Param=297M, Steps=100K2022.03 | 43.88 | 42 | |
| RK4-blockLayers=12-6, #Param=297M, Steps=100K2022.03 | 43.81 | 41.9 | |
| Transformer-AdminBackbone=Transformer-Big2021.06 | 43.8 | — | |
| ADMINLayers=60-12, Steps=250K2022.03 | 43.8 | 41.8 | |
| BERT-fused NMTBackbone=Transformer-Big2021.06 | 43.78 | — | |
| BERT-fused modelLayers=6-62022.03 | 43.78 | — | |
| Data DiversificationBackbone=Transformer-Big2021.06 | 43.7 | — | |
| RK2-block (learnable gamma_i)Layers=6-6, #Param=221M, Steps=100K2022.03 | 43.59 | 41.6 | |
| RK4-blockLayers=6-6, #Param=221M, Steps=100K2022.03 | 43.55 | 41.6 | |
| MUSEBackbone=Transformer-Big2021.06 | 43.5 | — | |
| RK2-block (learnable gamma_i)Layers=24-6, #Param=123M, Steps=100K2022.03 | 43.48 | 41.5 | |
| RK2-blockLayers=6-6, #Param=221M, Steps=100K2022.03 | 43.34 | 41.3 | |
| SDTLayers=48-6, #Param=198M, Steps=100K2022.03 | 43.28 | 41.5 | |
| RK4-blockLayers=24-6, #Param=123M, Steps=100K2022.03 | 43.28 | 41.3 | |
| Depth GrowingBackbone=Transformer-Big2021.06 | 43.27 | — | |
| Depth growingLayers=8-82022.03 | 43.27 | — | |
| Residual-block-BigLayers=12-6, #Param=297M, Steps=100K2022.03 | 43.22 | 41.2 | |
| RK2-blockLayers=24-6, #Param=123M, Steps=100K2022.03 | 43.04 | 41.1 | |
| Residual-block-BigLayers=6-6, #Param=221M, Steps=100K2022.03 | 42.89 | 40.9 | |
| TransformerBackbone=Transformer-Big2021.06 | 42.69 | — | |
| Residual-blockLayers=24-6, #Param=123M, Steps=100K2022.03 | 42.67 | 40.6 | |
| RK4-blockLayers=6-6, #Param=69M, Steps=100K2022.03 | 42.56 | 40.6 | |
| RK2-block (learnable gamma_i)Layers=6-6, #Param=69M, Steps=100K2022.03 | 42.31 | 40.3 | |
| RK2-blockLayers=6-6, #Param=69M, Steps=100K2022.03 | 42.08 | 40.1 | |
| Shaw et al. (2018)Training Data=WMT'14 bitext2018.08 | 41.5 | — | |
| Ahmed et al. (2017)Training Data=WMT'14 bitext2018.08 | 41.4 | — | |
| Residual-blockLayers=6-6, #Param=69M, Steps=100K2022.03 | 41.05 | 39.1 | |
| Vaswani et al. (2017)Training Data=WMT'14 bitext2018.08 | 41 | — | |
| TransformerLayers=6-6, #Param=222M, Steps=300K2022.03 | 41 | — | |
| ResMLP-12layers=12, dimension=512, hidden MLP size=2,0482021.05 | 40.6 | — | |
| Gehring et al. (2017)Training Data=WMT'14 bitext2018.08 | 40.5 | — | |
| ConvS2S2021.05 | 40.5 | — | |
| ResMLP-6layers=6, dimension=512, hidden MLP size=2,0482021.05 | 40.3 | — | |
| GNMT2021.05 | 39.9 | — | |
| Transformer (base)2021.05 | 38.1 | — |