Audio-Visual Speech Recognition on LRS2 (clean)
2.2WERMIR-GAN
Evaluation Results
| Method | Links | |
|---|---|---|
| MIR-GANBackbone=Transformer, Learning Protocol=Self-Supervised2023.06 | 2.2 | |
| Base modelBackbone=Transformer, Learning Protocol=Self-Supervised2023.06 | 2.3 | |
| MoCo+wav2vecBackbone=Transformer, Learning Protocol=Self-Supervised2023.06 | 2.6 | |
| MIR-GANBackbone=Conformer, Learning Protocol=Supervised2023.06 | 3.2 | |
| Hyb-ConformerBackbone=Conformer, Learning Protocol=Supervised2023.06 | 3.7 | |
| Base modelBackbone=Conformer, Learning Protocol=Supervised2023.06 | 3.9 | |
| MIR-GANBackbone=Transformer, Learning Protocol=Supervised2023.06 | 4.5 | |
| Base modelBackbone=Transformer, Learning Protocol=Supervised2023.06 | 5.4 | |
| LF-MMI TDNNBackbone=TDNN, Learning Protocol=Supervised2023.06 | 5.9 | |
| Hyb-RNNBackbone=RNN, Learning Protocol=Supervised2023.06 | 7 | |
| TM-CTCBackbone=Transformer, Learning Protocol=Supervised2023.06 | 8.2 | |
| TM-seq2seqBackbone=Transformer, Learning Protocol=Supervised2023.06 | 8.5 | |
| VisG AV-HuBERT LargeParams=484M2026.04 | 9.925 | |
| AV-HuBERT BaseParams=160M2026.04 | 10.09 | |
| AV-HuBERT LargeParams=477M2026.04 | 10.3 | |
| VisG AV-HuBERT BaseParams=162M2026.04 | 10.58 |