Audio-Visual Speech Recognition on LRS3 + DEMAND Object Occlusion + Noise (test)
2.8Error Rate (PARK)CAV2vec
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| CAV2vecVisual Corruption Type=Object Occlusion + Noise, SNR Range=[-10 dB, 10 dB], Audio Noise Dataset=DEMAND2025.12 | 2.8 | 4.3 | 4.4 | 8.4 | 5.1 | 2.3 | 3.8 | 3.5 | 4.3 | |
| AV-HuBERTVisual Corruption Type=Object Occlusion + Noise, SNR Range=[-10 dB, 10 dB], Audio Noise Dataset=DEMAND2025.12 | 3.4 | 4.6 | 5.1 | 10.2 | 5.9 | 2.7 | 4.1 | 3.9 | 5 | |
| AV-data2vecVisual Corruption Type=Object Occlusion + Noise, SNR Range=[-10 dB, 10 dB], Audio Noise Dataset=DEMAND2025.12 | 3.4 | 4.5 | 5.1 | 10.3 | 6.2 | 2.7 | 4.1 | 4.4 | 5.1 | |
| AV-RelScoreVisual Corruption Type=Object Occlusion + Noise, SNR Range=[-10 dB, 10 dB], Audio Noise Dataset=DEMAND2025.12 | 3.4 | 4.5 | 5.1 | 9.3 | 5.4 | 2.8 | 3.9 | 3.8 | 4.8 | |
| BRAVEnVisual Corruption Type=Object Occlusion + Noise, SNR Range=[-10 dB, 10 dB], Audio Noise Dataset=DEMAND2025.12 | 4.6 | 7.3 | 6.6 | 14.9 | 8.1 | 3.3 | 6.1 | 13.5 | 8.1 |