Speech Recognition on WSJ nov93 (dev)
3WERLF-MMI
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LF-MMIUnit=bi-phone, LM=4-gram2020.05 | 3 | — | — | |
| Deep Speech 2Training=12K h labeled speech2019.10 | 4.42 | — | — | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=CHAR CONVLM2019.10 | 4.46 | 1.79 | — | |
| Supervised transfer-learning2019.10 | 4.99 | — | — | |
| wav2vecLanguage Model=CHAR CONVLM2019.10 | 5.1 | 2.11 | — | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.102021.07 | 5.42 | — | 2.75 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.152021.07 | 5.43 | — | 2.72 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.052021.07 | 5.53 | — | 2.8 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.202021.07 | 5.59 | — | 2.87 | |
| Lattice-free MMI2019.10 | 5.66 | — | — | |
| CATUnit=mono-phone, LM=4-gram2020.05 | 5.7 | — | — | |
| LAS BaselineAED model type=LAS, # of AM par's=17.8M, gamma=02021.07 | 5.7 | — | 2.97 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.352021.07 | 5.8 | — | 3.24 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.402021.07 | 5.83 | — | 3.19 | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.252021.07 | 5.99 | — | 3.14 | |
| LF-MMIUnit=mono-phone, LM=4-gram2020.05 | 6 | — | — | |
| E2E-LF-MMIUnit=bi-phone, LM=4-gram2020.05 | 6 | — | — | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.302021.07 | 6 | — | 3.02 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.252021.07 | 6.02 | — | 3.32 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.152021.07 | 6.09 | — | 3.54 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.202021.07 | 6.14 | — | 3.45 | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=4-gram LM2019.10 | 6.28 | 2.41 | — | |
| E2E-LF-MMIUnit=mono-phone, LM=4-gram2020.05 | 6.3 | — | — | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.302021.07 | 6.32 | — | 3.58 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.052021.07 | 6.41 | — | 3.7 | |
| Transformer Relaxed AttentionAED model type=Transformer, # of AM par's=16.8M, gamma=0.102021.07 | 6.54 | — | 3.79 | |
| Baseline (log-mel)Language Model=CHAR CONVLM2019.10 | 6.67 | 2.77 | — | |
| Transformer BaselineAED model type=Transformer, # of AM par's=16.8M, gamma=02021.07 | 6.69 | — | 3.91 | |
| Trainable frontend2019.10 | 6.8 | — | — | |
| CTC/attentionUnit=mono-char, LM=RNN2020.05 | 6.8 | — | — | |
| Moriya et al.2021.07 | 6.9 | — | — | |
| wav2vecLanguage Model=4-gram LM2019.10 | 6.96 | 2.73 | — | |
| LAS Relaxed AttentionAED model type=LAS, # of AM par's=17.8M, gamma=0.352021.07 | 7.1 | — | 3.81 | |
| Wav2letter++Unit=mono-char, LM=Conv2020.05 | 7.5 | — | — | |
| CATUnit=mono-char, LM=4-gram2020.05 | 8.1 | — | — | |
| Baseline (log-mel)Language Model=4-gram LM2019.10 | 8.57 | 3.32 | — | |
| Wav2letter++Unit=mono-char, LM=4-gram2020.05 | 9.5 | — | — | |
| vq-wav2vec GumbelLanguage Model=4-gram LM2019.10 | 9.55 | 3.93 | — | |
| EESENUnit=mono-phone, LM=3-gram2020.05 | 10.87 | — | — | |
| ESPnetUnit=mono-char, LM=RNN2020.05 | 12.4 | — | — | |
| vq-wav2vec Gumbel + BERT baseLanguage Model=None2019.10 | 13.4 | 4.13 | — | |
| Masked-VPCProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 13.6 | — | 4.4 | |
| Masked-NCEProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 14.5 | — | 5 | |
| HuBERT ObjProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 15.2 | — | 5.2 | |
| Future-VPCProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 15.5 | — | 5.4 | |
| wav2vecLanguage Model=None2019.10 | 16.24 | 5.07 | — | |
| VQ-APCProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 16.8 | — | 5.8 | |
| log MelProbing with seq2seq=true, Lexicon-free=true, No language model=true2025.12 | 18.2 | — | 6.8 | |
| Baseline (log-mel)Language Model=None2019.10 | 19.46 | 6.28 | — | |
| wav2letter++Probing with seq2seq=false, Lexicon-free=true, No language model=true2025.12 | 19.5 | — | 6.3 | |
| vq-wav2vec GumbelLanguage Model=None2019.10 | 20.44 | 7.04 | — | |
| 18L TransformerProbing with seq2seq=false, Lexicon-free=true, No language model=true2025.12 | 22.2 | — | — |