Audio-Visual Speech-to-Audio Translation on LRS3-T low-resource scenario En-Es
50.9ASR-BLEUAV2AV
Evaluation Results
| Method | Links | |
|---|---|---|
| AV2AVFinetuning data size=200hr2023.12 | 50.9 | |
| AV-TranSpeechFinetuning data size=200hr2023.12 | 45.2 | |
| AV2AVFinetuning data size=30hr2023.12 | 44.6 | |
| AV2AVFinetuning data size=10hr2023.12 | 39.8 | |
| AV2AVFinetuning data size=0hr2023.12 | 25.3 | |
| AV-TranSpeechFinetuning data size=30hr2023.12 | 22.2 | |
| AV-TranSpeechFinetuning data size=10hr2023.12 | 21.5 |