Speech-to-Speech Translation on LRS3-T Es-En
97.04BLEUVideo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VideoTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 97.04 | — | |
| Audio+Wav2LipTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 87.73 | — | |
| Unit+Unit2LipTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 83.98 | 4.35 | |
| Unit+U2S+Wav2LipTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 81.03 | 4.22 | |
| ASR+NMT+TTS+Wav2LipTextual Dataset (SRC)=ASR+NMT, Textual Dataset (TGT)=NMT+TTS2023.12 | 64.09 | 4.16 | |
| TransFaceTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 61.93 | 4.12 | |
| TransFace+boundedTextual Dataset (SRC)=None, Textual Dataset (TGT)=None, length_regulation=bounded duration predictor2023.12 | 61.06 | 4.25 | |
| S2ST+Wav2LipTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 60.93 | 3.99 | |
| ST+TTS+Wav2LipTextual Dataset (SRC)=ST, Textual Dataset (TGT)=TTS2023.12 | 51.2 | 3.76 | |
| Translatotron2+Wav2LipTextual Dataset (SRC)=None, Textual Dataset (TGT)=None2023.12 | 42.31 | 3.34 |