ResearchDatasetsAVSpeechFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsSpeech-to-PortraitAVSpeech (test)31.26L1 Error6Visual Acoustic MatchingAVSpeech-Rooms unseen environments (test)0.071RTE (s)5Audio-Visual Speech RecognitionAVSpeech (1,000 manually filtered samples)25WER4Audio-Visual Speech ExtractionAVSpeech10.2SI-SDR (dB)1