Speech Recognition on WSJ nov92 (test)
1.42WERFast Conformer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Fast ConformerDecoder=RNNT2023.05 | 1.42 | — | |
| ConformerDecoder=RNNT2023.05 | 1.47 | — | |
| Fast ConformerDecoder=CTC2023.05 | 1.59 | — | |
| ConformerDecoder=CTC2023.05 | 1.7 | — | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=CHAR CONVLM2019.10 | 2.34 | 0.93 | |
| wav2vec largeLanguage Model=CHAR CONVLM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 2.43 | 0.99 | |
| wav2vecLanguage Model=CHAR CONVLM2019.10 | 2.43 | 0.99 | |
| Supervised transfer-learningphoneme-based=true2019.04 | 2.53 | — | |
| wav2vec largeLanguage Model=WORD CONVLM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 2.53 | 1.02 | |
| Supervised transfer-learning2019.10 | 2.53 | — | |
| wav2vecLanguage Model=CHAR CONVLM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 2.78 | 1.15 | |
| Lattice-free MMIphoneme-based=true2019.04 | 2.8 | — | |
| Lattice-free MMI2019.10 | 2.8 | — | |
| wav2vecLanguage Model=WORD CONVLM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 2.87 | 1.25 | |
| Deep Speech 2labeled speech=12K h2019.04 | 3.1 | — | |
| Deep Speech 2Training=12K h labeled speech2019.10 | 3.1 | — | |
| Log-mel filterbanks (Baseline)Language Model=CHAR CONVLM2019.04 | 3.46 | 1.53 | |
| Baseline (log-mel)Language Model=CHAR CONVLM2019.10 | 3.46 | 1.53 | |
| Trainable frontend2019.04 | 3.5 | — | |
| Trainable frontend2019.10 | 3.5 | — | |
| Log-mel filterbanks (Baseline)Language Model=WORD CONVLM2019.04 | 3.6 | 1.51 | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=4-gram LM2019.10 | 3.62 | 1.26 | |
| wav2vec largeLanguage Model=4-GRAM LM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 4.32 | 1.57 | |
| wav2vecLanguage Model=4-gram LM2019.10 | 4.32 | 1.57 | |
| wav2vecLanguage Model=4-GRAM LM, Pre-training Data=Librispeech, Pre-training Hours=960h2019.04 | 4.57 | 1.76 | |
| wav2vecLanguage Model=4-GRAM LM, Pre-training Data=Libri + WSJ, Pre-training Hours=1,041 h2019.04 | 4.61 | 1.67 | |
| wav2vecLanguage Model=4-GRAM LM, Pre-training Data=Librispeech, Pre-training Hours=80h2019.04 | 5.55 | 2.17 | |
| Log-mel filterbanks (Baseline)Language Model=4-GRAM LM2019.04 | 5.64 | 2.19 | |
| Baseline (log-mel)Language Model=4-gram LM2019.10 | 5.64 | 2.19 | |
| vq-wav2vec GumbelLanguage Model=4-gram LM2019.10 | 6.1 | 2.4 | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=None2019.10 | 9.39 | 2.62 | |
| wav2vecLanguage Model=None2019.10 | 11.2 | 3.26 | |
| Baseline (log-mel)Language Model=None2019.10 | 13.93 | 4.14 | |
| vq-wav2vec GumbelLanguage Model=None2019.10 | 14.67 | 4.51 |