Machine Translation on WMT'16 Romanian-English (Ro-En) (test)
40.4BLEUNoisy Channel Modeling
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Noisy Channel ModelingChannel model architecture=big, Beam size=502020.11 | 40.4 | — | — | — | |
| Fast Noisy Channel ModelingChannel model architecture=base_1_1, Beam size=502020.11 | 40.3 | — | — | — | |
| SOTA (Supervised)Training=Supervised2020.05 | 39.9 | — | — | — | |
| mBART02Beam size=52020.11 | 39.9 | — | — | — | |
| mBART02Beam size=502020.11 | 39.9 | — | — | — | |
| Fast Noisy Channel ModelingChannel model architecture=base_1_1, Beam size=52020.11 | 39.8 | — | — | — | |
| Noisy Channel ModelingChannel model architecture=big, Beam size=52020.11 | 39.6 | — | — | — | |
| GPT-3Few-shot learning=Few-shot2020.05 | 39.5 | — | — | — | |
| GPT-3Few-shot learning=One-shot2020.05 | 38.6 | — | — | — | |
| dirDecoding method=Direct2020.11 | 38.4 | — | — | — | |
| Tuned BARTTuning protocol=Tuned, Back-translation data=Yes, Beam width=5, Length penalty=12019.10 | 37.96 | — | — | — | |
| BaselineArchitecture=Transformer-large, Back-translation data=Yes, Beam width=5, Length penalty=12019.10 | 36.8 | — | — | — | |
| Fixed BARTTuning protocol=Fixed, Back-translation data=Yes, Beam width=5, Length penalty=12019.10 | 36.29 | — | — | — | |
| Levenshtein TransformerTraining teacher=distillation (autoregressive teacher model), Model architecture=Transformer base2019.05 | 33.26 | 90 | 2.03 | — | |
| MASSTraining=Unsupervised2020.05 | 33.1 | — | — | — | |
| Levenshtein TransformerTraining teacher=oracle, Model architecture=Transformer base2019.05 | 33.02 | 97 | 2.19 | — | |
| TransformerDecoding strategy=beam-search (beam=4), Model architecture=Transformer base2019.05 | 32.3 | 349 | 27.1 | — | |
| XLMTraining=Unsupervised2020.05 | 31.8 | — | — | — | |
| TransformerDecoding strategy=greedy, Model architecture=Transformer base2019.05 | 31.67 | 326 | 27.1 | — | |
| mBARTTraining=Unsupervised2020.05 | 30.5 | — | — | — | |
| GPT-3Few-shot learning=Zero-shot2020.05 | 19.9 | — | — | — | |
| BlockwiseDrafting size (k)=10, Decoding Strategy=Blockwise, Backbone=Transformer-base2025.08 | — | — | — | 1.4 | |
| BlockwiseDrafting size (k)=25, Decoding Strategy=Blockwise, Backbone=Transformer-base2025.08 | — | — | — | 1.2 | |
| CM-ASDDrafting size (k)=Adaptive, Decoding Strategy=CM-ASD, Backbone=Transformer-base2025.08 | — | — | — | 4.4 | |
| SpecDecDrafting size (k)=10, Decoding Strategy=SpecDec, Backbone=Transformer-base2025.08 | — | — | — | 4.1 | |
| SpecDecDrafting size (k)=25, Decoding Strategy=SpecDec, Backbone=Transformer-base2025.08 | — | — | — | 4.8 | |
| Transformer-baseBeam size (b)=5, Decoding Strategy=Autoregressive, Backbone=Transformer-base2025.08 | — | — | — | 1 | |
| Transformer-baseBeam size (b)=1, Decoding Strategy=Autoregressive, Backbone=Transformer-base2025.08 | — | — | — | 1.1 |