Speech Recognition on WSJ 93 (test)
4.98WERDS2
Evaluation Results
| Method | Links | |
|---|---|---|
| DS2Model type=RNN, Parameters=100M, Architecture=7 layers bidirectional simple recurrence with 3 layers of 2D-invariant convolution2015.12 | 4.98 | |
| DS1Description=5-layer model with 1 recurrent layer2015.12 | 6.94 | |
| QuartzNet-5x3Language Model=T-XL, Parameters=6.4M2019.10 | 7 | |
| Wav2Letter++Language Model=convLM, Parameters=17M2019.10 | 7.5 | |
| wav2letter++LM=ConvLM2019.04 | 7.5 | |
| Human2015.12 | 8.08 | |
| QuartzNet-5x3Language Model=4-gram, Parameters=6.4M2019.10 | 8.1 | |
| Jasper 10x3LM=Transformer-XL2019.04 | 9.3 | |
| Wav2Letter++Language Model=4-gram, Parameters=17M2019.10 | 9.5 | |
| wav2letter++LM=4-gram2019.04 | 9.5 | |
| ResCNN-LASLanguage Model=3-gram, Parameters=6.6M2019.10 | 9.7 | |
| Jasper 10x3LM=4-gram2019.04 | 9.9 | |
| Jasper 10x32019.04 | 16.1 |