Automatic Speech Recognition on LibriSpeech clean (test)
0.98WERUnited-MedASR
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| United-MedASR2024.11 | 0.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InfoMamba2026.03 | 1.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 1.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 1.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OracleDescription=Topline for rescoring2026.06 | 1.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio2Params=null2026.01 | 1.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 1.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-OmniSize=30B-A3B2026.04 | 1.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-A3B-InstructVariant=Omni-A3B-Instruct2026.03 | 1.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 1.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 1.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni#Param=30B2026.05 | 1.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursModel Size=2.3B2026.04 | 1.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioModel Size=7B2026.02 | 1.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio2026.03 | 1.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 1.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 1.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLM-based correctionExternal Data=ChatGPT, more datasets2025.12 | 1.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio-InstructModel Size=7B2025.08 | 1.3 | — | — | 1.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APinSetting=Aggressive (τin=0.80, τdeep=0.70), lin=✓, ldeep=-, FRR=86.28, Pre. GFLOPs=351.18, FLOPs Ratio=86.242026.04 | 1.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioSize=9B2026.04 | 1.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioParams=null2026.01 | 1.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-Audio-7B-InstructType=Audio, Size=7B2026.02 | 1.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio-2-miniVersion=2-mini2026.03 | 1.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FAdam2024.11 | 1.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vanillalin=-, ldeep=-, FRR=100.0, Pre. GFLOPs=407.22, FLOPs Ratio=100.02026.04 | 1.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APinSetting=Conservative (τin=0.90, τdeep=0.80), lin=✓, ldeep=-, FRR=96.44, Pre. GFLOPs=392.69, FLOPs Ratio=96.432026.04 | 1.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APdeepSetting=Conservative (τin=0.90, τdeep=0.80), lin=-, ldeep=✓, FRR=71.18, Pre. GFLOPs=390.42, FLOPs Ratio=95.872026.04 | 1.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPSetting=Conservative (τin=0.90, τdeep=0.80), lin=✓, ldeep=✓, FRR=68.19, Pre. GFLOPs=376.14, FLOPs Ratio=92.362026.04 | 1.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 1.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 1.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 1.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio Flamingo 3Type=Audio, Size=8B2026.02 | 1.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| pre-trained Conformer XXL + Noisy StudentUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training + Self-Training2021.06 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SOTA2021.09 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Conformer + Wav2vec 2.0 + SpecAugment-based Noisy Student Training with Libri-Light2024.11 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| w2v-BERT XXL2024.11 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SOTA2026.01 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Granite Speech 3.3-8BAudio Data=76k hrs, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-o 4.5Size=9B2026.04 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Previous SOTA2026.06 | 1.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Step-Audio-2-miniType=Audio, Size=8B2026.02 | 1.41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAPSetting=Aggressive (τin=0.80, τdeep=0.70), lin=✓, ldeep=✓, FRR=40.71, Pre. GFLOPs=324.64, FLOPs Ratio=79.722026.04 | 1.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 1.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| parakeet-rnnt-1.1b2024.11 | 1.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eureka-Audio-InstructType=Ours, Size=1.7B2026.02 | 1.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CanarySize/h=31,200, Params/B=1.00, Evaluation Protocol=short-form2026.01 | 1.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APdeepSetting=Aggressive (τin=0.80, τdeep=0.70), lin=-, ldeep=✓, FRR=48.81, Pre. GFLOPs=377.39, FLOPs Ratio=92.682026.04 | 1.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CanarySize=1B2026.06 | 1.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-QwenSize=2.5B2026.06 | 1.49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| pre-trained Conformer XXLUnlabeled Data=LL-60k, LM=LSTM, Training Type=Pre-Training2021.06 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0 + self-trainingUnlabeled Data=LL-60k, LM=Transformer, Training Type=Pre-Training + Self-Training2021.06 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Conv + Transformer + wav2vec2.0 + pseudo labeling2024.11 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Denoising LMExternal Data=YourTTS2025.12 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-1b-flashArchitecture Type=AR, Params (B)=1.0, RTFx=29.25, Avg. WER=7.22026.02 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Conformer XXLAudio Data=LL-60k, Supervision Type=Self-supervised pretraining (LL-60k)2024.05 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| baseline ASR (LS+TTS) + corr.-firstAudio Data=LS-960h, Supervision Type=Proposed Correction-first decoding2024.05 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fun-ASRParams=7.7B2026.01 | 1.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Voxtral Small-24BModel Size=24B2026.02 | 1.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-Omni-7BType=Omni, Size=7B2026.02 | 1.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AF-Next-Instruct2026.04 | 1.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 1.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 1.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio Flamingo 32026.04 | 1.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed-ASR (ML)Language=EN2024.07 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed-ASRParams=null2026.01 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Seed-ASR2026.03 | 1.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eureka-Audio-BaseType=Ours, Size=1.7B2026.02 | 1.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEST-RQModality=A, LibriSpeech PT=false, HowTo100M Pretrained Params=None, Notes=LibriSpeech trained model evaluated directly2023.03 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Universal-1Language=EN2024.07 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-Audio2025.02 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni-InstructType=Omni, Size=30B-A3B2026.02 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-AudioArchitecture Type=AR, Params (B)=8.4, RTFx=4.18, Avg. WER=8.32026.02 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZipformerAudio Data=LS-960h, Supervision Type=No external audio data2024.05 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-Qwen-2.5BAudio Data=234k hrs, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-ASR-1.7BAudio Data=40M hrs +, Supervision Type=Large-scale supervised / Speech LLMs2024.05 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECLMParams=0.5B, Decoding Strategy=corr.-first, Latency (ms)=4572024.05 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 0 | — | — | — | — | — | |
| Qwen2-AudioModel Size=7B2026.03 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CTC + AEDNum. layers Enc.=24, Num. layers Dec.=8, Text-util.=-2026.04 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-AudioSize=7B2026.06 | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Canary-QwenFine-tuning Protocol=Zero-shot2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Hard Routing, Classifier Type=Ground-Truth Routing2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Hard Routing, Classifier Type=Weighted-layer Classifier (Single-Stage)2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Hard Routing, Classifier Type=Weighted-layer Classifier (Coarse-to-Fine)2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Hard Routing, Classifier Type=Weighted-layer Classifier (Coarse-to-Fine), Entropy-Aware Routing (EAR)=true2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Soft Routing, Classifier Type=Weighted-layer Classifier (Coarse-to-Fine)2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| C-DR MoERouting Strategy=Soft Routing, Classifier Type=Weighted-layer Classifier (Coarse-to-Fine), Entropy-Aware Routing (EAR)=true2026.06 | 1.61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ROVERSNR=20dB2026.06 | 1.62 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-ASR-1.7B2026.03 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongCat-Next2026.03 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Transformer2025.08 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 196 | |
| Hybrid DecodingPatch size K=12025.08 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58 | |
| Hybrid DecodingPatch size K=32025.08 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 59 | |
| Hybrid DecodingPatch size K=52025.08 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 60 | |
| Hybrid DecodingPatch size K=72025.08 | 1.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 62 |