Audio-Visual Speech Recognition
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
25.8WER (Babble, -10 dB)
7
Feb 27, 2026
5.6WER
7
Feb 26, 2026
89.4Accuracy (Ara)
7
Feb 26, 2026
7WER
6
Feb 26, 2026
2.8Error Rate (PARK)
5
Feb 27, 2026
74WER
5
Feb 27, 2026
32.5WER
5
Feb 27, 2026
9.9WER
5
Feb 26, 2026
10.7WER
5
Feb 26, 2026
21.8WER
5
Feb 26, 2026
2.34Overall Error Rate
4
Jun 30, 2026
5.08Error Rate (0 dB SNR)
4
Jun 30, 2026
7.82WER (0 dB)
4
Jun 30, 2026
16.52CER (-10 dB)
4
Apr 2, 2026
16.64CER (-10 dB)
4
Apr 2, 2026
17.79CER (-10 dB)
4
Apr 2, 2026
30.66CER (-10 dB SNR)
4
Apr 2, 2026
22.21WER (-10 dB)
4
Apr 2, 2026
22.76WER (-10 dB SNR)
4
Apr 2, 2026
24.13WER (-10 dB)
4
Apr 2, 2026
41.65WER (-10 dB)
4
Apr 2, 2026
6.49CER (-10 dB)
4
Apr 2, 2026
7.11CER (-10 dB)
4
Apr 2, 2026
5.1CER (-10 dB SNR)
4
Apr 2, 2026
23.47CER (-10 dB)
4
Apr 2, 2026