Automatic Speech Recognition on LRS3 low-resource (test)
0.016WERSerdyuk et al. (2022)
Evaluation Results
| Method | Links | |
|---|---|---|
| Serdyuk et al. (2022)Encoder=Conformer, LM=false, Lab hrs=90,000*2022.12 | 0.016 | |
| RAVEn w/ self-trainingEncoder=Transformer, LM=true, Unlab hrs=1,759, Lab hrs=30, Model size=Large2022.12 | 0.019 | |
| Serdyuk et al. (2021)Encoder=Transformer, LM=false, Lab hrs=90,000*2022.12 | 0.023 | |
| RAVEn w/ self-trainingEncoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Large2022.12 | 0.023 | |
| RAVEnEncoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Large2022.12 | 0.027 | |
| Shi et al. (2022)Encoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Large2022.12 | 0.029 | |
| Hsu et al. (2021)Encoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Large2022.12 | 0.032 | |
| RAVEnEncoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Base2022.12 | 0.038 | |
| RAVEnEncoder=Transformer, LM=false, Unlab hrs=433, Lab hrs=30, Model size=Base2022.12 | 0.047 | |
| Makino et al. (2019)Encoder=RNN, LM=false, Lab hrs=31,000*2022.12 | 0.048 | |
| Shi et al. (2022)Encoder=Transformer, LM=false, Unlab hrs=433, Lab hrs=30, Model size=Base2022.12 | 0.049 | |
| Hsu et al. (2021)Encoder=Transformer, LM=false, Unlab hrs=1,759, Lab hrs=30, Model size=Base2022.12 | 0.05 | |
| Hsu et al. (2021)Encoder=Transformer, LM=false, Unlab hrs=433, Lab hrs=30, Model size=Base2022.12 | 0.054 | |
| Xu et al. (2020)Encoder=RNN, LM=false, Lab hrs=5902022.12 | 0.072 | |
| Afouras et al. (2018a)Encoder=Transformer, LM=true, Lab hrs=1,519*2022.12 | 0.083 | |
| Large modelEncoder=Transformer, LM=false, Lab hrs=30, Pre-training=from scratch2022.12 | 0.099 | |
| Zhang et al. (2022)Encoder=Transformer, LM=false, Unlab hrs=433, Lab hrs=30, Model size=Base2022.12 | 0.109 | |
| Base modelEncoder=Transformer, LM=false, Lab hrs=30, Pre-training=from scratch2022.12 | 0.185 |