Speech Recognition on WSJ (92-eval)
1.3WERSOTA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SOTA2021.09 | 1.3 | — | |
| ConformerXXL-LibriLight2021.09 | 1.3 | — | |
| ConformerXXL-RNNT-P2021.09 | 1.3 | — | |
| ConformerXXL-RNNT-P + Downstream NST2021.09 | 1.6 | — | |
| ConformerXXL-RNNT-PS#2021.09 | 1.6 | — | |
| Kaldi (s5)token=char2019.09 | 2.3 | — | |
| LF-MMIUnit=bi-phone, LM=4-gram2020.05 | 2.7 | — | |
| TDNN-DTraining Criterion=CTC-CRF2020.11 | 2.91 | — | |
| E2E-LF-MMIUnit=bi-phone, LM=4-gram2020.05 | 3 | — | |
| SS-LF-MMI2020.11 | 3 | — | |
| EE-LF-MMI2020.11 | 3 | — | |
| Deep Speech 22019.09 | 3.1 | — | |
| E2E-LF-MMIUnit=mono-phone, LM=4-gram2020.05 | 3.1 | — | |
| CATUnit=mono-phone, LM=4-gram2020.05 | 3.2 | — | |
| VGG-BLSTMTraining Criterion=CTC-CRF2020.11 | 3.2 | — | |
| ESPRESSOArchitecture=LSTM, Look-ahead Word LM=true, Improved Coverage=true, EOS Threshold=true, Beam Size=502019.09 | 3.4 | — | |
| ESPRESSO2020.11 | 3.4 | — | |
| Chan and Lane, 2015b2017.12 | 3.5 | — | |
| CNN-DNN-BLSTM-HMMSpeaker adaptation=true, Acoustic states=3k2018.12 | 3.5 | — | |
| Learnable front-endFilters=80, Language Model=ConvLM2018.12 | 3.5 | — | |
| State of the artLanguage=English2019.08 | 3.5 | — | |
| Zeghidour et al.2019.09 | 3.5 | — | |
| ESPRESSOArchitecture=LSTM, Look-ahead Word LM=true, Improved Coverage=true, EOS Threshold=false, Beam Size=502019.09 | 3.5 | — | |
| FC-SR2020.11 | 3.5 | — | |
| DS2Model type=RNN, Parameters=100M, Architecture=7 layers bidirectional simple recurrence with 3 layers of 2D-invariant convolution2015.12 | 3.6 | — | |
| Amodei et al.Notes=Used more training data2017.12 | 3.6 | — | |
| Amodei et al., 2016Additional Data=true2017.12 | 3.6 | — | |
| DeepSpeech 2Training hours=12k, Acoustic Model (AM)=true, LM=common crawl2018.12 | 3.6 | — | |
| Likhomanenko et al.2019.09 | 3.6 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.302021.07 | 3.65 | 1.91 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.352021.07 | 3.65 | 1.85 | |
| Learnable front-endFilters=40, Language Model=ConvLM2018.12 | 3.7 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.402021.07 | 3.74 | 1.95 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.152021.07 | 3.77 | 1.9 | |
| BLSTMTraining Criterion=CTC-CRF2020.11 | 3.79 | — | |
| IMS-SpeechLanguage=English2019.08 | 3.8 | — | |
| ESPNET2019.09 | 3.8 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.252021.07 | 3.83 | 2.11 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.102021.07 | 3.87 | 1.88 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.302021.07 | 3.88 | 1.85 | |
| Panayotov et al., 20152017.12 | 3.9 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.202021.07 | 3.91 | 2.16 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.202021.07 | 3.92 | 1.96 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.152021.07 | 3.96 | 2.16 | |
| ConformerXXL-RNNT-P + Downstream NST (Non-filtered)2021.09 | 4 | — | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.052021.07 | 4.02 | 2.06 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.252021.07 | 4.02 | 2.13 | |
| Wav2Letter++Language Model=convLM, Parameters=17M2019.10 | 4.1 | — | |
| E2E Lattice-free MMIData augmentation=true2018.12 | 4.1 | — | |
| Mel-filterbanksLanguage Model=ConvLM2018.12 | 4.1 | — | |
| wav2letter++LM=ConvLM2019.04 | 4.1 | — | |
| E2E LF-MMILM=3-gram2019.04 | 4.1 | — | |
| Hadian et al.2019.09 | 4.1 | — | |
| Wav2letter++Unit=mono-char, LM=Conv2020.05 | 4.1 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.102021.07 | 4.1 | 2.26 | |
| LAS BaselineAED model type=LAS, # of AM par's=17.8M, gamma=02021.07 | 4.18 | 2.11 | |
| Moriya et al.2021.07 | 4.2 | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.052021.07 | 4.28 | 2.34 | |
| Povey et al., 20162017.12 | 4.3 | — | |
| CTC/attentionUnit=mono-char, LM=RNN2020.05 | 4.4 | — | |
| ESPnet Transformertoken=char2019.09 | 4.4 | — | |
| Masked-NCELanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 4.4 | — | |
| Transformer BaselineAED model type=Transformer, # of AM par's=16.8M, gamma=02021.07 | 4.45 | 2.46 | |
| QuartzNet-5x3Language Model=T-XL, Parameters=6.4M2019.10 | 4.5 | — | |
| HuBERT ObjLanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 4.6 | — | |
| Masked-VPCLanguage Model=4-gram word language model, Fine-tuning Protocol=CTC2025.12 | 4.6 | — | |
| Multi-objective Policy LearningTraining Dataset=LibriSpeech2017.12 | 4.67 | — | |
| ESPnet RNNtoken=char2019.09 | 4.7 | — | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.352021.07 | 4.73 | 2.55 | |
| oracleRNNLM=yes2019.04 | 4.8 | 2 | |
| BLSTMTraining Criterion=CTC2020.11 | 4.93 | — | |
| DS1Description=5-layer model with 1 recurrent layer2015.12 | 4.94 | — | |
| CATUnit=mono-char, LM=4-gram2020.05 | 5 | — | |
| Human2015.12 | 5.03 | — | |
| Human2017.12 | 5.03 | — | |
| ESPRESSOArchitecture=LSTM, Look-ahead Word LM=true, Improved Coverage=false, EOS Threshold=false, Beam Size=502019.09 | 5.1 | — | |
| LF-MMIUnit=mono-phone, LM=4-gram2020.05 | 5.3 | — | |
| Zhou et al., 2018Data Augmentation=true2017.12 | 5.5 | — | |
| Multi-objective Policy LearningTraining Dataset=WSJ2017.12 | 5.53 | — | |
| EE-Policy-CTC2020.11 | 5.53 | — | |
| Wav2Letter++Language Model=4-gram, Parameters=17M2019.10 | 5.6 | — | |
| Hori et al., 20172017.12 | 5.6 | — | |
| Gated ConvNet (ASG)Criterion=ASG2017.12 | 5.6 | — | |
| Mel-filterbanksLanguage Model=4-gram2018.12 | 5.6 | — | |
| wav2letter++LM=4-gram2019.04 | 5.6 | — | |
| Wav2letter++Unit=mono-char, LM=4-gram2020.05 | 5.6 | — | |
| QuartzNet-5x3Language Model=4-gram, Parameters=6.4M2019.10 | 5.8 | — | |
| ResCNN-LASLanguage Model=3-gram, Parameters=6.6M2019.10 | 6.7 | — | |
| Chorowski and Jaitly2017.12 | 6.7 | — | |
| Chorowski and Jaitly, 20162017.12 | 6.7 | — | |
| Liu et al., 2017Data Augmentation=true2017.12 | 6.7 | — | |
| Jasper 10x3LM=Transformer-XL2019.04 | 6.9 | — | |
| Jasper 10x3LM=4-gram2019.04 | 7.1 | — | |
| EESENUnit=mono-phone, LM=3-gram2020.05 | 7.28 | — | |
| Miao et al., 20152017.12 | 7.3 | — | |
| Miao et al.2017.12 | 7.34 | — | |
| Graves and Jaitly2017.12 | 8.2 | — | |
| Wu et al.2017.12 | 8.2 | — | |
| Graves and Jaitly, 20142017.12 | 8.2 | — | |
| wav2letter++Language Model=None, Fine-tuning Protocol=CTC2025.12 | 8.57 | — |