Automatic Speech Recognition on LRS3 high-resource (test)
1.3WERShi et al. (2022)
Evaluation Results
| Method | Links | |
|---|---|---|
| Shi et al. (2022)Paradigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.3 | |
| RAVEnParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.4 | |
| RAVEn w/ self-trainingParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.4 | |
| RAVEn w/ self-trainingParadigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=true, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.4 | |
| Hsu et al. (2021)Paradigm=self-supervised (large, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.5 | |
| RAVEnParadigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 1.9 | |
| Shi et al. (2022)Paradigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 2 | |
| Large modelParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 2.2 | |
| RAVEnParadigm=self-supervised (base, less pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=433, Labeled hrs=4332022.12 | 2.2 | |
| Hsu et al. (2021)Paradigm=self-supervised (base, more pre-training), Encoder=Transformer, Language Model=false, Unlabeled hrs=1759, Labeled hrs=4332022.12 | 2.4 | |
| Base modelParadigm=from scratch, Encoder=Transformer, Language Model=false, Labeled hrs=4332022.12 | 2.5 |