Automatic Speech Recognition on LibriSpeech (dev-clean)
1.06WER (%)Step-Audio2-mini
Evaluation Results
| Method | Links | |
|---|---|---|
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 1.06 | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 1.08 | |
| wav2vec 2.0 + self-trainingUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training + Self-Training2021.06 | 1.1 | |
| OursModel Size=2.3B2026.04 | 1.11 | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 1.25 | |
| pre-trained Conformer XXL + Noisy StudentUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training + Self-Training2021.06 | 1.3 | |
| Qwen2-AudioModel Size=7B2026.03 | 1.3 | |
| ASR + DLM (DLM-sum)ASR Model=Conformer CTC, Decoding strategy=DLM-sum2025.12 | 1.48 | |
| pre-trained Conformer XXLUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training2021.06 | 1.5 | |
| HUBERT LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 1.5 | |
| HUBERT X-LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 1.5 | |
| ASR + DLM (DSR)ASR Model=Conformer CTC, Decoding strategy=DSR2025.12 | 1.5 | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 1.54 | |
| ASAPP-ASR2020.05 | 1.55 | |
| Improved T/SLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=LSTM2020.05 | 1.6 | |
| wav2vec 2.0Labeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=Transf.2020.05 | 1.6 | |
| Noisy studentUnlabeled data=LV-60k, LM=LSTM2020.06 | 1.6 | |
| wav2vec 2.0 LARGEUnlabeled data=LV-60k, LM=Transf.2020.06 | 1.6 | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=before2020.05 | 1.6 | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=after2020.05 | 1.6 | |
| Noisy StudentUnlabeled Data=LV-60k, LM=LSTM, Training Type=Self-Training2021.06 | 1.6 | |
| wav2vec 2.0 LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 1.6 | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 1.63 | |
| wav2vec 2.0 LARGE - from scratchUnlabeled data=None, LM=Transf.2020.06 | 1.7 | |
| wav2vec 2.0 LARGEUnlabeled data=LS-960, LM=Transf.2020.06 | 1.7 | |
| HUBERT X-LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 1.7 | |
| CW-LgTraining Labels=960h, Architecture=Conformer-based wav2vec 2.0, Parameters=618M2020.10 | 1.7 | |
| CW-LgTraining Labels=960h, Architecture=Conformer-based wav2vec 2.0, Parameters=618M2020.10 | 1.7 | |
| ASR onlyASR Model=Conformer CTC2025.12 | 1.75 | |
| multi-stream self-attentionParameters=23M2019.10 | 1.8 | |
| CONV. TRANSF. [19]AM Type=CONV. TRANSF., AM Lexicon=6K TRIPHONES, LM Type=3GRAM, RESCORED + TDNN + LSTM, LM Lexicon=WORD2019.11 | 1.8 | |
| wav2vec 2.0 BASEUnlabeled data=LS-960, LM=Transf.2020.06 | 1.8 | |
| HUBERT LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 1.8 | |
| wav2vec 2.0 BASELanguage Model=Transformer2021.10 | 1.8 | |
| SpeechT5Language Model=Transformer2021.10 | 1.8 | |
| Qwen-AudioModel Size=7B2026.03 | 1.8 | |
| GLM-ASR-nanoModel Size=1.5B (↓)2026.04 | 1.82 | |
| Han, et al.citation=[20]2020.05 | 1.84 | |
| IPLLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=4-gram + Transf.*2020.05 | 1.85 | |
| IPLLabeled data=LS-960, Unlabeled data=LV-54K, LM=4-gram + Transf.*2020.05 | 1.85 | |
| Iter. pseudo-labelingUnlabeled data=LV-60k, LM=4-gram+Transf.2020.06 | 1.85 | |
| IPLUnlabeled Data=LL-60k, LM=4-gram + Transformer, Training Type=Self-Training2021.06 | 1.85 | |
| Lüscher, et al.Backbone=BiLSTM2019.10 | 1.9 | |
| hybrid DNN/HMMtype=hybrid, seq. disc., AM label unit=CDp, LM label unit=word, Language Model=Transformer rescoring2019.05 | 1.9 | |
| Luscher, et al.2020.05 | 1.9 | |
| HMM/BILSTM + TRANSF. RESCORINGAM Type=HMM/BILSTM, AM Lexicon=12K CDP, LM Type=+ TRANSF., LM Lexicon=WORD2019.11 | 1.9 | |
| wav2vec 2.0 (LARGE)Labeled data=100h, Unlabeled data=LV-60k, LM=Transf.2020.06 | 1.9 | |
| ContextNetUnlabeled data=None, LM=LSTM2020.06 | 1.9 | |
| ContextNetTraining Paradigm=Supervised2020.05 | 1.9 | |
| RWTH+LMLM fusion=yes2021.03 | 1.9 | |
| VGGCONV2D8LM fusion=yes2021.03 | 1.9 | |
| VGGCONV2D4+TR0TR configuration=TR0, LM fusion=yes2021.03 | 1.9 | |
| VGGCONV2D4+TR2TR configuration=TR2, LM fusion=yes2021.03 | 1.9 | |
| wav2vec 2.0 LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 1.9 | |
| OLAModel Size=7B2026.03 | 1.9 | |
| HumanOmni-SpeakerModel Size=3B2026.03 | 1.91 | |
| TRANSF. (296M) - LIBRIVOX + DECODING/RESCORINGAM Type=Transformer, AM Lexicon=10K WP, LM Type=GCNN + TRANSF., LM Lexicon=WORD, Parameters=296M, Training Set=LIBRIVOX2019.11 | 2 | |
| wav2vec 2.0Labeled Data (hours)=LS-100, Unlabeled Data (hours)=LV-54K, LM=Transf.2020.05 | 2 | |
| Semi-supervision with PL, S2SLabeled data=LS-960, Unlabeled data=LV-54K, LM=GCNN WP + Transf.*2020.05 | 2 | |
| S2S Transf. + PLUnlabeled data=LV-60k, LM=CLM+Transf.2020.06 | 2 | |
| Synnaeve et al.Training Paradigm=Semi-supervised2020.05 | 2 | |
| CONV2D4+TR0TR configuration=TR0, LM fusion=yes2021.03 | 2 | |
| wav2vec 2.0 BASELanguage Model=4-gram2021.10 | 2 | |
| BaselineLanguage Model=Transformer2021.10 | 2 | |
| MANAR-4K.128.128Memory Size (M)=4K (every third layer) / 256 (others), ACR Size (m)=128 (every third layer), Encoder=12-layer Transformer, Decoding=official 4-gram language model [24]2026.03 | 2 | |
| Qwen2.5-OmniModel Size=3B2026.03 | 2 | |
| Semi-supervision with PL, CTCLabeled data=LS-960, Unlabeled data=LV-54K, LM=GCNN + Transf.*2020.05 | 2.01 | |
| IPLLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=None2020.05 | 2.05 | |
| IPLLabeled data=LS-960, Unlabeled data=LV-54K, LM=-2020.05 | 2.05 | |
| Semantic Mask + LMLM fusion=yes2021.03 | 2.05 | |
| ASR + DLM (greedy)ASR Model=Conformer CTC, Decoding strategy=greedy2025.12 | 2.09 | |
| Synnaeve, et al.semi-supervision=false2020.05 | 2.1 | |
| TRANSF. (270M) - LIBRISPEECH + DECODING/RESCORINGAM Type=Transformer, AM Lexicon=10K WP, LM Type=GCNN + TRANSF., LM Lexicon=WORD, Parameters=270M, Training Set=LIBRISPEECH2019.11 | 2.1 | |
| wav2vec 2.0Labeled Data (hours)=LS-100, Unlabeled Data (hours)=LS-860, LM=Transf.2020.05 | 2.1 | |
| wav2vec 2.0 (LARGE)Labeled data=100h, Unlabeled data=LS-960, LM=Transf.2020.06 | 2.1 | |
| S2S Transf.Unlabeled data=None, LM=CLM+Transf.2020.06 | 2.1 | |
| ConformerUnlabeled data=None, LM=LSTM2020.06 | 2.1 | |
| CTC Transf. + PLUnlabeled data=LV-60k, LM=CLM+Transf.2020.06 | 2.1 | |
| Synnaeve et al.Training Paradigm=Supervised2020.05 | 2.1 | |
| Transformer+LMLM fusion=yes2021.03 | 2.1 | |
| HUBERT X-LARGELabeled data amount=10-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 2.1 | |
| W-LgTraining Labels=960h, Architecture=wav2vec 2.0, Parameters=315M2020.10 | 2.1 | |
| TRANSF. (296M) - LIBRIVOXAM Type=Transformer, AM Lexicon=10K WP, Parameters=296M, Training Set=LIBRIVOX2019.11 | 2.12 | |
| Karita, et al.Backbone=Transformer2019.10 | 2.2 | |
| hybrid DNN/HMMtype=hybrid, seq. disc., AM label unit=CDp, LM label unit=word, Language Model=LSTM2019.05 | 2.2 | |
| HMM/BILSTMAM Type=HMM/BILSTM, AM Lexicon=12K CDP, LM Type=4GRAM+LSTM, LM Lexicon=WORD2019.11 | 2.2 | |
| TRANSFORMERSAM Type=TRANSFORMERS, AM Lexicon=BPE, LM Type=RNN, LM Lexicon=WORD2019.11 | 2.2 | |
| wav2vec 2.0 (BASE)Labeled data=100h, Unlabeled data=LS-960, LM=Transf.2020.06 | 2.2 | |
| CTC TransfUnlabeled data=None, LM=CLM+Transf.2020.06 | 2.2 | |
| ESPnet Transformer+LMLM fusion=yes2021.03 | 2.2 | |
| CONV2D4+TR2TR configuration=TR2, LM fusion=yes2021.03 | 2.2 | |
| ESPnet Transformer2019.09 | 2.2 | |
| HUBERT LARGELabeled data amount=10-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 2.2 | |
| SlimIPLLabeled data amount=100-hour, Unlabeled Data=LS-860, LM=4-gram + Transformer2021.06 | 2.2 | |
| data2vecEncoder=12-layer Transformer, Decoding=official 4-gram language model [24]2026.03 | 2.2 | |
| Squeezeformer-LParams (M)=236.3, GFLOPs=277.9, Throughput (ex/s)=2072022.06 | 2.27 | |
| RWTH (HMM)2019.09 | 2.3 | |
| MANAR-256.64.128Memory Size (M)=256, ACR Size (m)=64, Encoder=12-layer Transformer, Decoding=official 4-gram language model [24]2026.03 | 2.3 | |
| Squeezeformer-MLParams (M)=125.1, GFLOPs=169.2, Throughput (ex/s)=2682022.06 | 2.34 | |
| wav2vec 2.0 (LARGE)Labeled data=10h, Unlabeled data=LV-60k, LM=Transf.2020.06 | 2.4 |