Visual Speech Recognition on Multilingual TEDx-Spanish (MTes) (test)
56.6Mean WERVSR model with prediction-based auxiliary tasks
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW+LRS2+LRS3+AVSpeech, Training Set=CMes+MTes, Training Sets Total Size (hours)=15462022.02 | 56.6 | 0.3 | 56.3 | |
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW+LRS2+LRS3, Training Set=CMes+MTes, Training Sets Total Size (hours)=9052022.02 | 56.9 | 0.5 | 56.5 | |
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW, Training Set=CMes+MTes, Training Sets Total Size (hours)=2442022.02 | 60.8 | 0.8 | 60.3 | |
| CM-seq2seqPre-training Set=LRW, Training Set=CMes+MTes, Training Sets Total Size (hours)=2442022.02 | 66.4 | 0.8 | 65.2 |