Video-to-speech synthesis on LRS3 (test)
1.3PESQSVTS w/ RAVEn
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SVTS w/ RAVEnEncoder=Transformer, Training dataset=LRS3+Vox2-en2022.12 | 1.3 | 0.56 | 0.36 | — | — | |
| Mira et al. (2022)Encoder=Conformer, Training dataset=LRS3+Vox2-en2022.12 | 1.26 | 0.53 | 0.31 | — | — | |
| SVTS from scratchEncoder=Transformer, Training dataset=LRS3+Vox2-en2022.12 | 1.26 | 0.53 | 0.3 | — | — | |
| Mira et al. (2022)Encoder=Conformer, Training dataset=LRS32022.12 | 1.25 | 0.51 | 0.27 | — | — |