Audio-visual Speech Recognition on TED LRS3
0.009WERVGG CONFORMER
Evaluation Results
| Method | Links | |
|---|---|---|
| VGG CONFORMERVisual Front-End=VGG, Encoder=CONFORMER, Train Data (Hours)=100K2023.02 | 0.009 | |
| LP CONFORMERVisual Front-End=LINEAR PROJECTION, Encoder=CONFORMER, Train Data (Hours)=100K2023.02 | 0.009 | |
| U-HUBERTVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=2K2023.02 | 0.012 | |
| AV-HUBERTVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=2K2023.02 | 0.013 | |
| VIT 3DVisual Front-End=VIT, Encoder=CONFORMER, Train Data (Hours)=90K2023.02 | 0.016 | |
| RESNET CONFORMERVisual Front-End=CONV3D+RESNET, Encoder=CONFORMER, Train Data (Hours)=0.5K2023.02 | 0.023 | |
| VGG TRANSFORMERVisual Front-End=VGG, Encoder=TRANSFORMER, Train Data (Hours)=90K2023.02 | 0.03 | |
| RNN-TVisual Front-End=CONV3D, Encoder=LSTM, Train Data (Hours)=31K2023.02 | 0.045 | |
| TM-SEQ2SEQVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=0.5K2023.02 | 0.08 | |
| TM-CTCVisual Front-End=RESNET, Encoder=TRANSFORMER, Train Data (Hours)=0.5K2023.02 | 0.123 |