Phoneme Recognition on TIMIT (test)
8.3PERwav2vec 2.0
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| wav2vec 2.0Language Model=none, Model size=Large, Pre-training=LS-9602020.06 | 8.3 | — | — | — | — | — | — | |
| Train from oracleGreedy decoding=true2024.02 | 9.2 | — | — | — | — | — | — | |
| Masked-VPCEvaluation protocol=Fine-Tuning2025.12 | 11 | — | — | — | — | — | — | |
| HuBERT ObjEvaluation protocol=Fine-Tuning2025.12 | 11.3 | — | — | — | — | — | — | |
| vq-wav2vec + BERT smallQuantization Method=k-means, Architecture=CNN-8L-PReLU-do0.7, BERT Pre-training=BERT small2019.10 | 11.4 | — | — | — | — | — | — | |
| vq-wav2vec2020.06 | 11.6 | — | — | — | — | — | — | |
| vq-wav2vec + BERT smallQuantization Method=Gumbel, Architecture=CNN-8L-PReLU-do0.7, BERT Pre-training=BERT small2019.10 | 11.64 | — | — | — | — | — | — | |
| CNN+BLSTMFeature=Raw-Wav, Architecture=CNN+BLSTM2026.06 | 12.3 | — | — | — | — | — | — | |
| REBORNGreedy decoding=true2024.02 | 12.4 | — | — | — | — | — | — | |
| SincNet+BLSTMFeature=Raw-Wav, Architecture=SincNet+BLSTM2026.06 | 12.5 | — | — | — | — | — | — | |
| Sinc2Net+BLSTMFeature=Raw-Wav, Architecture=Sinc2Net+BLSTM2026.06 | 12.6 | — | — | — | — | — | — | |
| Masked-NCEEvaluation protocol=Fine-Tuning2025.12 | 12.9 | — | — | — | — | — | — | |
| FBank-83-WSJFeature=FBank-83-WSJ, Architecture=Best System in [2]2026.06 | 13.1 | — | — | — | — | — | — | |
| MLP+Li-GRU+MLPArchitecture=MLP+Li-GRU+MLP, Features=MFCC+FBANK+fMLLR2018.11 | 13.8 | — | — | — | — | — | — | |
| FBank-83Architecture=Best System in [2]2026.06 | 14.1 | — | — | — | — | — | — | |
| Li-GRUArchitecture=Li-GRU, Features=fMLLR2018.11 | 14.2 | — | — | — | — | — | — | |
| wav2vec2019.10 | 14.7 | — | — | — | — | — | — | |
| wav2vec2020.06 | 14.7 | — | — | — | — | — | — | |
| Li-GRU + fMLLR2019.10 | 14.9 | — | — | — | — | — | — | |
| Li-GRU + fMLLR2020.06 | 14.9 | — | — | — | — | — | — | |
| Sinc2Net+BLSTMFeature=Raw-Wav–Proposed2026.06 | 15.3 | — | — | — | — | — | — | |
| SincNet+BLSTMFeature=Raw-Wav–Proposed2026.06 | 15.6 | — | — | — | — | — | — | |
| CNN+BLSTMFeature=Raw-Wav–Proposed2026.06 | 15.8 | — | — | — | — | — | — | |
| Raw-WavArchitecture=ParzNet2026.06 | 16.5 | — | — | — | — | — | — | |
| Raw-WavArchitecture=CNN, Reference=[44]2026.06 | 16.5 | — | — | — | — | — | — | |
| wav2vec-U+WFSTGreedy decoding=false, Language Model=4-gram2024.02 | 16.8 | — | — | — | — | — | — | |
| Raw-WavArchitecture=Sinc2Net2026.06 | 16.9 | — | — | — | — | — | — | |
| Raw-WavArchitecture=GaussNet2026.06 | 17 | — | — | — | — | — | — | |
| Raw-WavArchitecture=CGCNN2026.06 | 17.1 | — | — | — | — | — | — | |
| PASE+2020.06 | 17.2 | — | — | — | — | — | — | |
| Raw-WavArchitecture=SincNet, Reference=[12]2026.06 | 17.2 | — | — | — | — | — | — | |
| Raw-WavArchitecture=GammaNet2026.06 | 17.2 | — | — | — | — | — | — | |
| Baseline (log-mel)2019.10 | 17.6 | — | — | — | — | — | — | |
| TransducerParameters=4.3M2019.07 | 17.7 | — | — | — | — | — | — | |
| vq-wav2vecQuantization Method=Gumbel, Architecture=CNN-8L-PReLU-do0.7, BERT Pre-training=None2019.10 | 17.78 | — | — | — | — | — | — | |
| CNN + TD-filterbanksReference=Zeghidour et al., 2018a2019.04 | 18 | — | — | — | — | — | — | |
| CNN + TD-filterbanks2019.10 | 18 | — | — | — | — | — | — | |
| CNN + TD-filterbanks2020.06 | 18 | — | — | — | — | — | — | |
| Raw-WavArchitecture=CNN, Reference=[12]2026.06 | 18.1 | — | — | — | — | — | — | |
| ARSGParameters=around 6M2019.07 | 18.7 | — | — | — | — | — | — | |
| vq-wav2vecQuantization Method=k-means, Architecture=CNN-8L-PReLU-do0.7, BERT Pre-training=None2019.10 | 18.73 | — | — | — | — | — | — | |
| Raw-Wav (E2E)Architecture=SincNet2026.06 | 19.3 | — | — | — | — | — | — | |
| LASParameters=5.6M2019.07 | 20.2 | — | — | — | — | — | — | |
| wav2vec-U (reproduced)Greedy decoding=true2024.02 | 20.3 | — | — | — | — | — | — | |
| LAS-MTL-SParameters=7.1M2019.07 | 20.4 | — | — | — | — | — | — | |
| LAS-MTL-MParameters=7.1M2019.07 | 20.8 | — | — | — | — | — | — | |
| Raw-Wav (E2E)Architecture=CNN2026.06 | 21.1 | — | — | — | — | — | — | |
| Semi-CRFMaximum segment duration (K)=30, Decoder Type=Semi-CRF, Encoder Architecture=3-layer BiLSTM, Number of parameters=~1.6M + 1,170 duration bias, Training Epochs=502026.04 | 21.8 | 47.6 | 91.9 | 21.5 | 5.529 | 3.651 | 206.8 | |
| Linear CRFMaximum segment duration (K)=1, Decoder Type=Linear CRF, Encoder Architecture=3-layer BiLSTM, Number of parameters=~1.6M, Training Epochs=502026.04 | 21.9 | 46.8 | 91.4 | 20.7 | 5.687 | 3.651 | 183.7 | |
| Raw-WavArchitecture=CNN, Reference=[17]2026.06 | 21.9 | — | — | — | — | — | — | |
| LAS-FParameters=5.6M2019.07 | 23.4 | — | — | — | — | — | — | |
| 12L TransformerEvaluation protocol=Baseline2025.12 | 24.1 | — | — | — | — | — | — |