Loading the SOTA2 catalog…
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement · SOTA2 Research