Automatic Speech Recognition on LibriSpeech (test-other)
1.6WEROracle Ocp
Evaluation Results
| Method | Links | ||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Oracle OcpType=compositional oracle2023.09 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Conformer LUnlabeled data (hrs)=None, LM Fusion=Yes2020.10 | 1.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OracleDescription=Topline for rescoring2026.06 | 2.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 2.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 2.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio-InstructModel Size=7B2025.08 | 2.4 | — | — | — | — | — | — | — | — | — | — | — | — | 2.4 | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioSize=9B2026.04 | 2.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio2026.03 | 2.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 2.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio-7BIn FR=12.5, Out FR=12.52026.06 | 2.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 2.47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-A3B-InstructVariant=Omni-A3B-Instruct2026.03 | 2.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni#Param=30B2026.05 | 2.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FAdamArchitecture=Conformer (600M), Pre-training=w2v-BERT, Fine-tuning protocol=Semi-supervised (LibriLight), Optimizer=FAdam2024.05 | 2.49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-OmniSize=30B-A3B2026.04 | 2.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 2.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 2.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APinSetting=Aggressive (τin=0.80, τdeep=0.70), lin=✓, ldeep=-, FRR=86.28, Pre. GFLOPs=351.18, FLOPs Ratio=86.242026.04 | 2.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio-7B-InstructType=Audio, Size=7B2026.02 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vanillalin=-, ldeep=-, FRR=100.0, Pre. GFLOPs=407.22, FLOPs Ratio=100.02026.04 | 2.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APdeepSetting=Conservative (τin=0.90, τdeep=0.80), lin=-, ldeep=✓, FRR=71.18, Pre. GFLOPs=390.42, FLOPs Ratio=95.872026.04 | 2.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdamArchitecture=Conformer (600M), Pre-training=w2v-BERT, Fine-tuning protocol=Semi-supervised (LibriLight), Optimizer=Adam2024.05 | 2.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APinSetting=Conservative (τin=0.90, τdeep=0.80), lin=✓, ldeep=-, FRR=96.44, Pre. GFLOPs=392.69, FLOPs Ratio=96.432026.04 | 2.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPSetting=Conservative (τin=0.90, τdeep=0.80), lin=✓, ldeep=✓, FRR=68.19, Pre. GFLOPs=376.14, FLOPs Ratio=92.362026.04 | 2.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| pre-trained Conformer XXL + Noisy StudentUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training + Self-Training2021.06 | 2.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SOTA2021.09 | 2.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen3 Conformer XXL+Unlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 2.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPSetting=Aggressive (τin=0.80, τdeep=0.70), lin=✓, ldeep=✓, FRR=40.71, Pre. GFLOPs=324.64, FLOPs Ratio=79.722026.04 | 2.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 2.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 2.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursModel Size=2.3B2026.04 | 2.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APdeepSetting=Aggressive (τin=0.80, τdeep=0.70), lin=-, ldeep=✓, FRR=48.81, Pre. GFLOPs=377.39, FLOPs Ratio=92.682026.04 | 2.68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adam (w2v-BERT paper)Architecture=Conformer (600M), Pre-training=w2v-BERT, Optimizer=Adam, Source=[53]2024.05 | 2.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen3 Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 2.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen3 Conformer XXL+Unlabeled data (hrs)=60k, LM Fusion=No2020.10 | 2.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Oracle OnbType=n-best oracle2023.09 | 2.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio-2-miniType=Audio, Size=8B2026.02 | 2.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AF-Next-Instruct2026.04 | 2.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen3 Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 2.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-o 4.5Size=9B2026.04 | 2.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-30B-A3BIn FR=12.5, Out FR=12.52026.06 | 2.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed-ASR (ML)Language=EN2024.07 | 2.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed-ASR2026.03 | 2.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio-2-miniVersion=2-mini2026.03 | 2.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Parameter ClusteringSparsity=10%, Parameters=1397M, Mixed sparsity=Yes, GFLOPs (Total / Trans.)=2499.16 / 2469.302026.06 | 2.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 2.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HUBERT X-LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HuBERT-x-largeImplementation=Fairseq, Speech Data (Unlabeled/Labeled)=60k/960, In-domain LM=true2026.01 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-1b-flashArchitecture Type=AR, Params (B)=1.0, RTFx=29.25, Avg. WER=7.22026.02 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HuBERT-XLAudio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Granite Speech 3.3-8BAudio Data=76k hrs, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 2.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CanarySize/h=31,200, Params/B=1.00, Evaluation Protocol=short-form2026.01 | 2.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-InstructType=Omni, Size=30B-A3B2026.02 | 2.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CanarySize=1B2026.06 | 2.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio 2 mini2025.12 | 2.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio Flamingo 3Type=Audio, Size=8B2026.02 | 2.96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 2.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SLAM-LLMBiasing list size (N)=10002026.01 | 2.99 | — | — | — | — | — | 9.33 | 2.31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| data2vec 2.0Audio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 3.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 3.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Transformer2025.08 | 3.08 | — | 177 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hybrid DecodingPatch size K=12025.08 | 3.08 | — | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hybrid DecodingPatch size K=32025.08 | 3.08 | — | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hybrid DecodingPatch size K=52025.08 | 3.08 | — | 58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hybrid DecodingPatch size K=72025.08 | 3.08 | — | 61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hybrid DecodingPatch size K=92025.08 | 3.08 | — | 62 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| pre-trained Conformer XXLUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training2021.06 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0 + self-trainingUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training + Self-Training2021.06 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pre-trained Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Universal-1Language=EN2024.07 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3 70BParameters=70B2024.07 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Conformer XXLAudio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-Qwen-2.5BAudio Data=234k hrs, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-QwenSize=2.5B2026.06 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio Flamingo 32026.04 | 3.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-1b-v2Model Type=ASR model2026.01 | 3.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Parakeet-tdt-0.6b-v32026.01 | 3.18 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-Omni-7BType=Omni, Size=7B2026.02 | 3.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pre-trained Conformer XLUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WavLM-largeImplementation=UniSpeech, Speech Data (Unlabeled/Labeled)=94k/960, In-domain LM=true2026.01 | 3.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Parakeet-TDT-v2Audio Data=120k hrs, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 3.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eureka-Audio-InstructType=Ours, Size=1.7B2026.02 | 3.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0 LARGEUnlabeled data=LV-60k, LM=Transf.2020.06 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0 LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HUBERT LARGEUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training2021.06 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConformerXXL-LibriLight2021.09 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gen4 Conformer LUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pre-trained CTCUnlabeled data (hrs)=60k, LM Fusion=Yes2020.10 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pre-trained Conformer XXLUnlabeled data (hrs)=60k, LM Fusion=No2020.10 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Denoising LMExternal Data=YourTTS2025.12 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0-largeImplementation=Fairseq, Speech Data (Unlabeled/Labeled)=60k/960, In-domain LM=true2026.01 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HuBERT-largeImplementation=Fairseq, Speech Data (Unlabeled/Labeled)=60k/960, In-domain LM=true2026.01 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0-LargeAudio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HuBERT-LargeAudio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| baseline ASR (LS+TTS) + corr.-firstAudio Data=LS-960h, Supervision Type=Proposed Correction-first decoding2024.05 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.02026.03 | 3.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eureka-Audio-BaseType=Ours, Size=1.7B2026.02 | 3.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 3.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |