Automatic Speech Recognition on LibriSpeech (dev-other)
2.1WERQwen3-Omni-Inst
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 2.1 | — | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 2.1 | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 2.39 | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 2.45 | — | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 2.48 | — | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 2.48 | — | |
| FAdamArchitecture=Conformer (600M), Pre-training=w2v-BERT, Fine-tuning protocol=Semi-supervised (LibriLight), Optimizer=FAdam2024.05 | 2.49 | — | |
| HUBERT X-LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 2.5 | — | |
| AdamArchitecture=Conformer (600M), Pre-training=w2v-BERT, Fine-tuning protocol=Semi-supervised (LibriLight), Optimizer=Adam2024.05 | 2.54 | — | |
| OursModel Size=2.3B2026.04 | 2.57 | — | |
| Adam (w2v-BERT paper)Architecture=Conformer (600M), Pre-training=w2v-BERT, Optimizer=Adam, Source=[53]2024.05 | 2.6 | — | |
| pre-trained Conformer XXL + Noisy StudentUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training + Self-Training2021.06 | 2.6 | — | |
| Gen3 Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 2.6 | — | |
| Gen3 Conformer XXL+Unlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 2.6 | — | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 2.63 | — | |
| wav2vec 2.0 + self-trainingUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training + Self-Training2021.06 | 2.7 | — | |
| Gen3 Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 2.7 | — | |
| Gen3 Conformer XXL+Unlabeled data (hrs)=60k, LM Fusion=No2020.10 | 2.7 | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 2.86 | — | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 2.92 | — | |
| wav2vec 2.0 LARGEUnlabeled data=LV-60k, LM=Transf.2020.06 | 3 | — | |
| wav2vec 2.0 LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 3 | — | |
| pre-trained Conformer XXLUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training2021.06 | 3 | — | |
| HUBERT LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 3 | — | |
| HUBERT X-LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 3 | — | |
| Pre-trained CTCUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3 | — | |
| Pre-trained Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3 | — | |
| Gen4 Conformer LUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.1 | — | |
| Parameter ClusteringSparsity=10%, Parameters=1397M, Mixed sparsity=Yes, GFLOPs (Total / Trans.)=2499.16 / 2469.302026.06 | 3.11 | — | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 3.14 | — | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 3.14 | — | |
| wav2vec 2.0Labeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=Transf.2020.05 | 3.2 | — | |
| Pre-trained Conformer XLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.2 | — | |
| Pre-trained Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 3.2 | — | |
| IPLLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=4-gram + Transf.*2020.05 | 3.26 | — | |
| IPLLabeled data=LS-960, Unlabeled data=LV-54K, LM=4-gram + Transf.*2020.05 | 3.26 | — | |
| Iter. pseudo-labelingUnlabeled data=LV-60k, LM=4-gram+Transf.2020.06 | 3.26 | — | |
| IPLUnlabeled Data=LL-60k, LM=4-gram + Transformer, Training Type=Self-Training2021.06 | 3.26 | — | |
| ASR + DLM (DLM-sum)ASR Model=Conformer CTC, Decoding strategy=DLM-sum2025.12 | 3.26 | — | |
| CTC + DLMNum. layers Enc.=40, Num. layers Dec.=8, Text-util.=-2026.04 | 3.29 | — | |
| Gen4 Conformer LUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 3.3 | — | |
| CTC + AEDNum. layers Enc.=24, Num. layers Dec.=8, Text-util.=-2026.04 | 3.31 | — | |
| Improved T/SLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=LSTM2020.05 | 3.4 | — | |
| Noisy studentUnlabeled data=LV-60k, LM=LSTM2020.06 | 3.4 | — | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=after2020.05 | 3.4 | — | |
| Noisy StudentUnlabeled Data=LV-60k, LM=LSTM, Training Type=Self-Training2021.06 | 3.4 | — | |
| Gen4 ContextNetUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.4 | — | |
| ASR + DLM (DSR)ASR Model=Conformer CTC, Decoding strategy=DSR2025.12 | 3.4 | — | |
| Qwen2-AudioModel Size=7B2026.03 | 3.4 | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=TTS+LM2026.04 | 3.41 | — | |
| CW-LgTraining Labels=960h, Architecture=Conformer-based wav2vec 2.02020.10 | 3.5 | — | |
| CW-LgTraining Labels=960h, Architecture=Conformer-based wav2vec 2.02020.10 | 3.5 | — | |
| Pre-trained Conformer XLUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 3.5 | — | |
| CTC + AEDNum. layers Enc.=16, Num. layers Dec.=6, Text-util.=TTS2026.04 | 3.53 | — | |
| CTCNum. layers Enc.=24, Num. layers Dec.=0, Text-util.=-2026.04 | 3.59 | — | |
| HUBERT X-LARGELabeled data amount=10-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 3.6 | — | |
| TRANSF. (296M) - LIBRIVOX + DECODING/RESCORINGAM Type=Transformer, AM Lexicon=10K WP, LM Type=GCNN + TRANSF., LM Lexicon=WORD, Parameters=296M, Training Set=LIBRIVOX2019.11 | 3.65 | — | |
| Semi-supervision with PL, S2SLabeled data=LS-960, Unlabeled data=LV-54K, LM=GCNN WP + Transf.*2020.05 | 3.65 | — | |
| S2S Transf. + PLUnlabeled data=LV-60k, LM=CLM+Transf.2020.06 | 3.65 | — | |
| Synnaeve et al.Training Paradigm=Semi-supervised2020.05 | 3.65 | — | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 3.65 | — | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 3.67 | — | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=before2020.05 | 3.7 | — | |
| HUBERT LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 3.7 | — | |
| Gen4 ContextNetUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 3.7 | — | |
| Autoregressive LMModel Dim=1024, Num Layers=24, Decoding Method=joint-decoding2026.04 | 3.86 | — | |
| ContextNetUnlabeled data=None, LM=LSTM2020.06 | 3.9 | — | |
| wav2vec 2.0 LARGEUnlabeled data=LS-960, LM=Transf.2020.06 | 3.9 | — | |
| ContextNetTraining Paradigm=Supervised2020.05 | 3.9 | — | |
| Conformer LUnlabeled data (hrs)=None, LM Fusion=Yes2020.10 | 3.9 | — | |
| GLM-ASR-nanoModel Size=1.5B (↓)2026.04 | 3.93 | — | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | 3.93 | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=LM2026.04 | 3.94 | — | |
| Semi-supervision with PL, CTCLabeled data=LS-960, Unlabeled data=LV-54K, LM=GCNN + Transf.*2020.05 | 3.95 | — | |
| Autoregressive LMModel Dim=768, Num Layers=12, Decoding Method=joint-decoding2026.04 | 3.98 | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=TTS2026.04 | 3.98 | — | |
| wav2vec 2.0 (LARGE)Labeled data=100h, Unlabeled data=LV-60k, LM=Transf.2020.06 | 4 | — | |
| wav2vec 2.0 LARGELabeled data amount=100-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 4 | — | |
| Qwen-Audiozero-shot=true2023.11 | 4 | — | |
| Qwen-AudioModel Size=7B2026.03 | 4 | — | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 4.05 | — | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 4.06 | — | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 4.06 | — | |
| ASR + DLM (greedy)ASR Model=Conformer CTC, Decoding strategy=greedy2025.12 | 4.08 | — | |
| wav2vec 2.0Labeled Data (hours)=LS-100, Unlabeled Data (hours)=LV-54K, LM=Transf.2020.05 | 4.1 | — | |
| Qwen2.5-OmniModel Size=3B2026.03 | 4.1 | — | |
| Autoregressive LMModel Dim=768, Num Layers=12, Decoding Method=rescoring2026.04 | 4.1 | — | |
| IPLLabeled Data (hours)=LS-960, Unlabeled Data (hours)=LV-54K, LM=None2020.05 | 4.12 | — | |
| IPLLabeled data=LS-960, Unlabeled data=LV-54K, LM=-2020.05 | 4.12 | — | |
| ASR onlyASR Model=Conformer CTC2025.12 | 4.13 | — | |
| HumanOmni-SpeakerModel Size=3B2026.03 | 4.16 | — | |
| Autoregressive LMModel Dim=1024, Num Layers=24, Decoding Method=rescoring2026.04 | 4.19 | — | |
| HUBERT X-LARGELabeled data amount=1-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 4.2 | — | |
| ASAPP-ASR2020.05 | 4.22 | — | |
| Whisper-large-v3 (Uncompressed)Sparsity=0%, Parameters=1550M, GFLOPs (Total / Trans.)=2773.53 / 2743.662026.06 | 4.25 | — | |
| ConformerUnlabeled data=None, LM=LSTM2020.06 | 4.3 | — | |
| wav2vec 2.0 LARGE - from scratchUnlabeled data=None, LM=Transf.2020.06 | 4.3 | — | |
| HUBERT LARGELabeled data amount=10-hour, Unlabeled Data=LL-60k, LM=Transformer2021.06 | 4.3 | — | |
| SpeechT5Language Model=Transformer2021.10 | 4.3 | — | |
| CTC + AEDNum. layers Enc.=16, Num. layers Dec.=6, Text-util.=-2026.04 | 4.33 | — |