Audio-Visual Speech Recognition
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.68WER
77
Apr 2, 2026
0.72WER
77
Mar 5, 2026
1.9WER
53
Jun 5, 2026
1.3WER
34
Feb 26, 2026
1.8WER
22
Mar 4, 2026
0.65WER
21
Jun 5, 2026
5.77WER (%)
16
Jun 5, 2026
4.07Word Error Rate (%)
16
Jun 5, 2026
4.05WER
16
Jun 5, 2026
3.86WER
16
Jun 5, 2026
2.2WER
16
Apr 2, 2026
0.008WER
14
Mar 24, 2026
0.188CER
13
Jun 5, 2026
0.385WER
12
Feb 26, 2026
43Overall Score
10
Feb 27, 2026
6.4WER (Overall)
10
Feb 27, 2026
0.009WER
10
Feb 26, 2026
49.5Accuracy (En)
9
Feb 27, 2026
2.5En Acc
9
Feb 27, 2026
5.2WER (-5 dB)
8
Jul 9, 2026
4.2Average Error Rate
8
Feb 27, 2026
1.7WER
7
Mar 5, 2026
1.3WER
7
Mar 5, 2026
26WER (Babble, -10 dB)
7
Feb 27, 2026
26.6WER (Babble, -10 dB)
7
Feb 27, 2026