Audio-Visual Speech Recognition on LRS3 noisy
4.2Average Error RateAV-HuBERT + CMA + MoHAVE
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AV-HuBERT + CMA + MoHAVEEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 4.2 | 7.3 | 2.8 | 3.3 | |
| AV-HuBERT + MoHAVEEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 4.5 | 7.7 | 3 | 3.6 | |
| AV-HuBERT + CMAEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 4.6 | 8.1 | 2.9 | 3.7 | |
| AV-HuBERT + UniVPMEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 5.2 | 9.3 | 4.1 | 3.6 | |
| AV-HuBERT + MIR-GANEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 5.6 | — | — | — | |
| AV-HuBERTEncoder architecture type=Noise-augmented AVSR encoder2025.12 | 5.7 | 9.7 | 4.6 | 4.2 | |
| BRAVEn + MoHAVEEncoder architecture type=Joint ASR and VSR encoders2025.12 | 9.8 | 12.3 | 13.4 | 6.8 | |
| BRAVEnEncoder architecture type=Joint ASR and VSR encoders2025.12 | 11 | 13.5 | 15.7 | 7.4 |