Visual Speech Recognition on CMU-MOSEAS-Spanish (CMes)
58.1Best ScoreCM-seq2seq
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CM-seq2seqPre-training Set=LRW, Training Set=CMes+MTes, Training Sets Total Size (hours)=2442022.02 | 58.1 | — | |
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW, Training Set=CMes+MTes, Training Sets Total Size (hours)=2442022.02 | 50.4 | — | |
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW+LRS2+LRS3, Training Set=CMes+MTes, Training Sets Total Size (hours)=9052022.02 | 47.2 | — | |
| VSR model with prediction-based auxiliary tasksPre-training Set=LRW+LRS2+LRS3+AVSpeech, Training Set=CMes+MTes, Training Sets Total Size (hours)=15462022.02 | 43.9 | — |