Speech-to-Text Translation on MuST-C (En-Ru) 1.0 (test)
20BLEUEnd-to-end (w2v2-mBART)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| End-to-end (w2v2-mBART)Learning Setup=Supervised learning + pre-training, Architecture=End-to-end2022.10 | 20 | — | |
| Multi. T-MdJoint training=8 languages2020.10 | 16 | — | |
| TransformerAdditional techniques=speed perturbation, pre-trained decoder, auxiliary CTC loss2020.10 | 15.8 | — | |
| T-Sm2020.10 | 15.3 | — | |
| End-to-end (S2T Transformer)Learning Setup=Supervised learning, Architecture=End-to-end2022.10 | 15.3 | — | |
| B-BaseLatency=Offline2020.10 | 13.7 | — | |
| B-BaseLatency=High, Beam size=12020.10 | 12.9 | 6.9 | |
| Transformer2020.10 | 10.5 | — | |
| Cascaded (ASR→TDN→MT)Learning Setup=Unsupervised learning, Architecture=Cascaded2022.10 | 10 | — | |
| End-to-end (w2v2-mBART)Learning Setup=Unsupervised learning, Architecture=End-to-end2022.10 | 9.8 | — | |
| B-BaseLatency=Mid, Beam size=12020.10 | 7.2 | 5.8 | |
| B-BaseLatency=Low, Beam size=12020.10 | 4.9 | 2.7 |