Speech Recognition on LRS3-TED
7.2WEREG-seq2seq
Evaluation Results
| Method | Links | |
|---|---|---|
| EG-seq2seqSNR dB=clean, Modality=Audio2020.05 | 7.2 | |
| TM-seq2seqSNR dB=clean, Modality=Audio2020.05 | 9 | |
| GoogleSNR dB=clean, Modality=Audio2020.05 | 10.4 | |
| LP CONFORMERVisual Front-End=LINEAR PROJECTION, Encoder=CONFORMER, Train Data (Hours)=100K2023.02 | 12.8 | |
| VIT 3DVisual Front-End=VIT, Encoder=CONFORMER, Train Data (Hours)=90K2023.02 | 17 | |
| AV-HUBERTVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=2K2023.02 | 26.9 | |
| U-HUBERTVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=2K2023.02 | 27.2 | |
| RNN-TVisual Front-End=CONV3D, Encoder=LSTM, Train Data (Hours)=31K2023.02 | 33.6 | |
| EG-seq2seqSNR dB=10, Modality=Audio2020.05 | 35.5 | |
| TM-seq2seqSNR dB=10, Modality=Audio2020.05 | 35.9 | |
| EG-seq2seqSNR dB=5, Modality=Audio2020.05 | 42.6 | |
| RESNET CONFORMERVisual Front-End=CONV3D+RESNET, Encoder=CONFORMER, Train Data (Hours)=0.5K2023.02 | 43.3 | |
| TM-seq2seqSNR dB=5, Modality=Audio2020.05 | 49 | |
| V2PVisual Front-End=CONV3D, Encoder=LSTM, Train Data (Hours)=4K2023.02 | 55.1 | |
| EG-seq2seqSNR dB=clean, Modality=Visual2020.05 | 57.8 | |
| EG-seq2seqSNR dB=0, Modality=Audio2020.05 | 58.2 | |
| TM-seq2seqSNR dB=clean, Modality=Visual2020.05 | 59.9 | |
| TM-SEQ2SEQVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=0.5K2023.02 | 59.9 | |
| TM-seq2seqSNR dB=0, Modality=Audio2020.05 | 60.5 | |
| GoogleSNR dB=0, Modality=Audio2020.05 | 70.3 | |
| TM-CTCVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=0.5K2023.02 | 74.7 | |
| EG-seq2seqSNR dB=-5, Modality=Audio2020.05 | 86.1 | |
| TM-seq2seqSNR dB=-5, Modality=Audio2020.05 | 87.9 | |
| TM-seq2seqSNR dB=-10, Modality=Audio2020.05 | 100 | |
| EG-seq2seqSNR dB=-10, Modality=Audio2020.05 | 100 |