Machine Translation on IWSLT De-En combined 2014 (test)
37.2BLEU ScoreOur Data Diversification with Dynamic Conv
Evaluation Results
| Method | Links | |
|---|---|---|
| Our Data Diversification with Dynamic ConvModel Architecture=Dynamic Conv, Training Strategy=Data Diversification2019.11 | 37.2 | |
| Our Data Diversification with TransformerModel Architecture=Transformer, Training Strategy=Data Diversification2019.11 | 37 | |
| Dynamic ConvModel Architecture=Dynamic Conv, Training Strategy=Baseline2019.11 | 35 | |
| TransformerModel Architecture=Transformer, Training Strategy=Baseline2019.11 | 34.7 | |
| Transformer with Multi-AgentModel Architecture=Transformer, Training Strategy=Multi-Agent2019.11 | 34.7 | |
| Transformer with Ens-DistillModel Architecture=Transformer, Training Strategy=Ensemble Distillation2019.11 | 34.7 | |
| Transformer with Distill (T=S)Model Architecture=Transformer, Training Strategy=Knowledge Distillation (T=S)2019.11 | 34.1 | |
| Transformer with Distill (T>S)Model Architecture=Transformer, Training Strategy=Knowledge Distillation (T>S)2019.11 | 33.6 | |
| Our Data Diversification with TransformerModel Architecture=Transformer, Training Strategy=Data Diversification2019.11 | 30.6 | |
| Our Data Diversification with Dynamic ConvModel Architecture=Dynamic Conv, Training Strategy=Data Diversification2019.11 | 30.6 | |
| Transformer with Multi-AgentModel Architecture=Transformer, Training Strategy=Multi-Agent2019.11 | 28.9 | |
| Transformer with Ens-DistillModel Architecture=Transformer, Training Strategy=Ensemble Distillation2019.11 | 28.8 | |
| Dynamic ConvModel Architecture=Dynamic Conv, Training Strategy=Baseline2019.11 | 28.7 | |
| TransformerModel Architecture=Transformer, Training Strategy=Baseline2019.11 | 28.6 | |
| Transformer with Distill (T=S)Model Architecture=Transformer, Training Strategy=Knowledge Distillation (T=S)2019.11 | 28.5 | |
| Transformer with Distill (T>S)Model Architecture=Transformer, Training Strategy=Knowledge Distillation (T>S)2019.11 | 28 |