Loading the SOTA2 catalog…
MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition · SOTA2 Research