Machine Translation on WMT English-French 2014 (test)
45.6BLEUSOTA (Supervised)
Evaluation Results
| Method | Links | |
|---|---|---|
| SOTA (Supervised)Training=Supervised2020.05 | 45.6 | |
| mRASPPre-training=mRASP, Fine-tuning=true, Beam Size=52022.03 | 44.3 | |
| 60L-12L ADMINEvaluation Script=multi-bleu.perl2020.08 | 43.8 | |
| Data DiversificationBase Model=Scale Transformer [18]2019.11 | 43.7 | |
| CeMATPre-training=CeMAT, Fine-tuning=true, Beam Size=52022.03 | 43.7 | |
| Wu et al., 2019bEvaluation Script=multi-bleu.perl2020.08 | 43.3 | |
| Wu et al., 2019aEvaluation Script=multi-bleu.perl2020.08 | 43.2 | |
| Ott et al., 2018Evaluation Script=multi-bleu.perl2020.08 | 43.2 | |
| Dynamic Conv2019.11 | 43.2 | |
| Scale Transformer2019.11 | 42.7 | |
| TransformerAugmentation=Ens-Distill [7]2019.11 | 42.5 | |
| TransformerAugmentation=Distill (T=S) [14]2019.11 | 42.1 | |
| Vaswani et al., 2017Evaluation Script=multi-bleu.perl2020.08 | 41.8 | |
| 60L-12L ADMINEvaluation Script=sacreBLEU.py2020.08 | 41.8 | |
| Transformer (big)2017.06 | 41.8 | |
| Transformer2019.11 | 41.8 | |
| Trans+Rel. Pos2019.11 | 41.5 | |
| Ott et al., 2018Evaluation Script=sacreBLEU.py2020.08 | 41.4 | |
| DirectTraining=From scratch, Beam Size=52022.03 | 41.4 | |
| So et al., 2019Evaluation Script=multi-bleu.perl2020.08 | 41.3 | |
| ConvS2S EnsembleTraining Cost (FLOPs)=1.2 * 10^212017.06 | 41.29 | |
| GNMT + RL EnsembleTraining Cost (FLOPs)=1.1 * 10^212017.06 | 41.16 | |
| mBARTPre-training=mBART, Fine-tuning=true, Beam Size=52022.03 | 41 | |
| MoETraining Cost (FLOPs)=1.2 * 10^202017.06 | 40.56 | |
| Gehring et al., 2017Evaluation Script=multi-bleu.perl2020.08 | 40.5 | |
| ConvS2STraining Cost (FLOPs)=1.5 * 10^202017.06 | 40.46 | |
| Deep-Att + PosUnk EnsembleTraining Cost (FLOPs)=8.0 * 10^202017.06 | 40.4 | |
| SEQUENCEM=6, N=182021.04 | 40.18 | |
| CYCLEM=6, N=182021.04 | 40.17 | |
| CYCLE (REV)M=6, N=182021.04 | 40.13 | |
| GNMT + RLTraining Cost (FLOPs)=1.4 * 10^202017.06 | 39.92 | |
| Deep-Att + PosUnkTraining Cost (FLOPs)=1.0 * 10^202017.06 | 39.2 | |
| UniversalM=1, N=62021.04 | 38.84 | |
| TransformerAugmentation=Distill (T>S) [14]2019.11 | 38.6 | |
| VanillaM=6, N=62021.04 | 38.41 | |
| Transformer (base model)2017.06 | 38.1 | |
| MASSTraining=Unsupervised2020.05 | 37.5 | |
| XLMTraining=Unsupervised2020.05 | 33.4 | |
| GPT-3Few-shot learning=Few-shot2020.05 | 32.6 | |
| GPT-3Few-shot learning=One-shot2020.05 | 28.3 | |
| GPT-3Few-shot learning=Zero-shot2020.05 | 25.2 |