Machine Translation on Multi30k M30kT (test)
50.77BLEU ScoreSupervised
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| SupervisedDecoding=greedy, Supervision=supervised2017.10 | 50.77 | — | — | — | — | — | — | |
| Doubly-ATT#Params=3.2M, Backbone=Transformer-Tiny2021.05 | 33.95 | — | — | — | — | — | — | |
| Gated Fusion#Params=2.9M, Backbone=Transformer-Tiny2021.05 | 33.59 | — | — | — | — | — | — | |
| Transformer-Tiny#Params=2.6M2021.05 | 33.36 | — | — | — | — | — | — | |
| Transformer-Small#Params=36.5M2021.05 | 32.99 | — | — | — | — | — | — | |
| RMMT#Params=2.9M, Backbone=Transformer-Tiny2021.05 | 32.94 | — | — | — | — | — | — | |
| Imagination#Params=7.0M, Backbone=Transformer-Tiny2021.05 | 32.89 | — | — | — | — | — | — | |
| Transformer + PS-KDDirection=DE-EN, Technique=Progressive Self-Knowledge Distillation2020.06 | 32.3 | — | — | — | — | — | — | |
| GMNMT#Params=4.0M2021.05 | 32.2 | — | — | — | — | — | — | |
| UVR-NMT#Params=2.9M, Backbone=Transformer-Tiny2021.05 | 32.16 | — | — | — | — | — | — | |
| Our modelDecoding=greedy, Iteration=3rd, Supervision=unsupervised2017.10 | 32.07 | — | — | — | — | — | — | |
| Transformer-Base#Params=49.1M2021.05 | 31.36 | — | — | — | — | — | — | |
| DCCN#Params=17.1M2021.05 | 31 | — | — | — | — | — | — | |
| Our modelDecoding=greedy, Iteration=2nd, Supervision=unsupervised2017.10 | 30.49 | — | — | — | — | — | — | |
| Transformer + LSDirection=DE-EN, Technique=Label Smoothing2020.06 | 29.3 | — | — | — | — | — | — | |
| TransformerDirection=DE-EN2020.06 | 29 | — | — | — | — | — | — | |
| Our modelDecoding=greedy, Iteration=1st, Supervision=unsupervised2017.10 | 28.07 | — | — | — | — | — | — | |
| oracle word reorderingDecoding=greedy, Supervision=unsupervised2017.10 | 24.88 | — | — | — | — | — | — | |
| word-by-wordDecoding=greedy, Supervision=unsupervised2017.10 | 16.77 | — | — | — | — | — | — | |
| Huang et al. (2016)Training data=M30kT, Pre-training data set=none2017.02 | — | 35.1 | 52.2 | — | — | — | — | |
| Huang et al. (2016) + RCNNTraining data=M30kT, Pre-training data set=none2017.02 | — | 36.5 | 54.1 | — | — | — | — | |
| NMTTraining data=M30kT, Pre-training data set=none2017.02 | — | 33.7 | 52.3 | 46.7 | 65.2 | 67.7 | 65 | |
| NMTTraining data=M30kT, Pre-training data set=back-translated M30kc (in-domain)2017.02 | — | 35.5 | 53.4 | 43.3 | 65.2 | 67.7 | 65 | |
| NMTTraining data=M30kT, Pre-training data set=WMT'15 English-German corpora (general domain)2017.02 | — | 37.8 | 56.7 | 41 | 69.2 | 69.7 | 69.1 | |
| NMT_SRC+IMGTraining data=M30kT, Pre-training data set=none2017.02 | — | 36.5 | 55 | 43.7 | 67.3 | 66.8 | 67.4 | |
| NMT_SRC+IMGTraining data=M30kT, Pre-training data set=back-translated M30kc (in-domain)2017.02 | — | 37.1 | 54.5 | 42.8 | 66.6 | 67.2 | 66.5 | |
| NMT_SRC+IMGTraining data=M30kT, Pre-training data set=WMT'15 English-German corpora (general domain)2017.02 | — | 39 | 56.8 | 40.6 | 69.6 | 69.6 | 69.6 | |
| PBSMTTraining data=M30kT, Pre-training data set=none2017.02 | — | 32.9 | 54.3 | 45.1 | 67.4 | 66.5 | 67.5 | |
| PBSMT (concat)Training data=M30kT, Pre-training data set=WMT'15 English-German corpora (general domain)2017.02 | — | 32.6 | 53.9 | 46.1 | 67.3 | 66.3 | 67.4 | |
| PBSMT (LM)Training data=M30kT, Pre-training data set=back-translated M30kc (in-domain)2017.02 | — | 34 | 55 | 44.7 | 68 | 66.8 | 68.1 | |
| PBSMT (LM)Training data=M30kT, Pre-training data set=WMT'15 English-German corpora (general domain)2017.02 | — | 32.5 | 54.1 | 46 | 67.3 | 66 | 67.4 |