Audio-Visual Speech Recognition on LRS3 noisy synthesized using MUSAN noise (test)
5.6WERMIR-GAN
Evaluation Results
| Method | Links | |
|---|---|---|
| MIR-GANBackbone=Transformer, Criterion=S2S, Unlabeled data (hrs)=1,759, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Self-Supervised2023.06 | 5.6 | |
| AV-HuBERTBackbone=Transformer, Criterion=S2S, Unlabeled data (hrs)=1,759, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Self-Supervised2023.06 | 5.8 | |
| Base modelBackbone=Transformer, Criterion=S2S, Unlabeled data (hrs)=1,759, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Self-Supervised2023.06 | 5.8 | |
| MIR-GANBackbone=Conformer, Criterion=S2S, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Supervised2023.06 | 8.5 | |
| Base modelBackbone=Conformer, Criterion=S2S, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Supervised2023.06 | 10.9 | |
| MIR-GANBackbone=Transformer, Criterion=S2S, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Supervised2023.06 | 11.7 | |
| Base modelBackbone=Transformer, Criterion=S2S, Labeled data (hrs)=433, DataAug=true, LM=false, Training Setting=Supervised2023.06 | 14.8 |