Loading the SOTA2 catalog…
M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition · SOTA2 Research