Automatic Speech Recognition on Hub5 2000 (SWB)
5.8WER2016 Microsoft system
Evaluation Results
| Method | Links | |
|---|---|---|
| 2016 Microsoft systemLanguage Model=Neural net LM2016.10 | 5.8 | |
| Human transcription2016.10 | 5.9 | |
| n-gram + model M + NNLMLanguage Model=n-gram + model M + NNLM2016.04 | 6.6 | |
| Saon et al. systemLanguage Model=Neural net LM2016.10 | 6.6 | |
| n-gram + NNLMLanguage Model=n-gram + NNLM2016.04 | 6.8 | |
| n-gram + model MLanguage Model=n-gram + model M2016.04 | 7 | |
| CATUnit=mono-phone, LM=4-gram, RNN-LM rescoring=true2020.05 | 7.3 | |
| 2016 Microsoft systemLanguage Model=N-gram LM2016.10 | 7.4 | |
| LF-MMIUnit=bi-phone, LM=4-gram, RNN-LM rescoring=true2020.05 | 7.5 | |
| 85K vocab n-gram baselineLanguage Model=85K vocab, 36M n-grams2016.04 | 7.6 | |
| Saon et al. systemLanguage Model=N-gram LM2016.10 | 7.6 | |
| E2E-LF-MMIUnit=bi-phone, LM=4-gram, RNN-LM rescoring=true2020.05 | 7.6 | |
| CATUnit=mono-phone, LM=4-gram, RNN-LM rescoring=false2020.05 | 7.9 | |
| RNN-TUnit=char, LM=4-gram, RNN-LM rescoring=false2020.05 | 8.1 | |
| AttentionUnit=char, LM=No LM, RNN-LM rescoring=false2020.05 | 8.3 | |
| LF-MMIUnit=bi-phone, LM=4-gram, RNN-LM rescoring=false2020.05 | 8.4 | |
| Povey et al. LSTMLanguage Model=N-gram LM2016.10 | 8.5 | |
| 30K vocab n-gram baselineLanguage Model=30K vocab, 4M n-grams2016.04 | 8.6 | |
| E2E-LF-MMIUnit=bi-phone, LM=4-gram, RNN-LM rescoring=false2020.05 | 8.6 | |
| E2E-LF-MMIUnit=mono-phone, LM=4-gram, RNN-LM rescoring=false2020.05 | 8.9 | |
| Saon et al. LSTMLanguage Model=N-gram LM2016.10 | 9 |