Automatic Speech Recognition on 80-hour WSJ (dev93)
5.7WERVGG-BLSTM
Evaluation Results
| Method | Links | |
|---|---|---|
| VGG-BLSTMTraining Criterion=CTC-CRF2020.11 | 5.7 | |
| ESPRESSO2020.11 | 5.9 | |
| SS-LF-MMI2020.11 | 6 | |
| BLSTMTraining Criterion=CTC-CRF2020.11 | 6.23 | |
| TDNN-DTraining Criterion=CTC-CRF2020.11 | 6.24 | |
| FC-SR2020.11 | 6.8 | |
| Masked-VPCLanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 6.8 | |
| HuBERT ObjLanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 7.3 | |
| Masked-NCELanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 7.8 | |
| BLSTMTraining Criterion=CTC2020.11 | 8.57 | |
| EE-Policy-CTC2020.11 | 9.21 | |
| Masked-VPCLanguage Model=None, Fine-tuning Protocol=CTC2025.12 | 14.1 | |
| Masked-NCELanguage Model=None, Fine-tuning Protocol=CTC2025.12 | 14.7 | |
| HuBERT ObjLanguage Model=None, Fine-tuning Protocol=CTC2025.12 | 15.5 | |
| wav2letter++Language Model=None, Fine-tuning Protocol=CTC2025.12 | 19.5 | |
| 12L TransformerLanguage Model=None, Fine-tuning Protocol=CTC2025.12 | 20.1 |