Visual Speech Recognition on LRS3 high-resource (test)
23.1WERRAVEn w/ self-training
Evaluation Results
| Method | Links | |
|---|---|---|
| RAVEn w/ self-trainingParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=true, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 23.1 | |
| RAVEn w/ self-trainingParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 24.4 | |
| Shi et al. (2022) w/ self-trainingParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 26.9 | |
| RAVEnParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 27.8 | |
| Shi et al. (2022)Paradigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 28.6 | |
| Ma et al. (2022)Paradigm=semi-supervised, Encoder=Conformer, Language Model=true, Unlabeled hrs=641, Labeled hrs=8182022.12 | 31.5 | |
| RAVEnParadigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 33.1 | |
| Shi et al. (2022)Paradigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 34.8 | |
| Large model w/ curriculumParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 38.8 | |
| RAVEnParadigm=self-supervised (base, less pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=433, Labeled hrs=4332022.12 | 39.1 | |
| Base model w/ curriculumParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 39.8 | |
| Shi et al. (2022)Paradigm=self-supervised (base, less pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=433, Labeled hrs=4332022.12 | 44 | |
| Ma et al. (2021a)Paradigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 49.6 | |
| Afouras et al. (2020)Paradigm=semi-supervised, Encoder=CNN, Language Model=true, Unlabeled hrs=344, Labeled hrs=4332022.12 | 59.8 | |
| Large modelParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 85.8 | |
| Base modelParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 87.3 |