Automatic Speech Recognition on LibriSpeech (test-clean)
0.6WEROracle Ocp
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Oracle OcpType=compositional oracle2023.09 | 0.6 | — | — | — | — | |
| Oracle OnbType=n-best oracle2023.09 | 1 | — | — | — | — | |
| Qwen3-Omni-30B-A3BIn FR=12.5, Out FR=12.52026.06 | 1.44 | — | — | — | — | |
| Step-Audio 2 mini2025.12 | 1.53 | — | — | — | — | |
| H2T-LoRAMethod=Low-rank adaptation (LoRA), Backbone=LlaMa-13B, rank=8, Batch size=1282023.09 | 1.7 | — | — | — | — | |
| FireRedASR2025.12 | 1.7 | — | — | — | — | |
| Qwen2-Audio-7BIn FR=252026.06 | 1.74 | — | — | — | — | |
| BaselineDescription=Raw ASR system output2023.09 | 1.8 | — | — | — | — | |
| LMrankType=Transformer-based language model re-ranking2023.09 | 1.8 | — | — | — | — | |
| H2T-ftMethod=Full fine-tuning, Epochs=20, Batch size=162023.09 | 1.8 | — | — | — | — | |
| Kimi-Audio-7BIn FR=12.5, Out FR=12.52026.06 | 1.8 | — | — | — | — | |
| Step-Audio2-mini2025.12 | 1.87 | — | — | — | — | |
| Index-ASR2025.12 | 1.92 | — | — | — | — | |
| Whisper-large-v3 (greedy)Decoder=Transformer, Params=907 M2026.06 | 1.97 | — | — | — | — | |
| FlexiSLM-7B-Stage3In FR=12.5, Out FR=12.52026.06 | 1.98 | — | — | — | — | |
| FlexiSLM-7B-Stage3In FR=12.5, Out FR=6.252026.06 | 1.98 | — | — | — | — | |
| Zipformer-L*Type=pruned transducer, Params (M)=148.4, GFLOPs=107.7, Note=Trained with 8 80G NVIDIA Tesla A100 GPUs for 170 epochs2023.10 | 2 | — | — | — | — | |
| Zipformer-LType=pruned transducer, Params (M)=148.4, GFLOPs=107.72023.10 | 2.06 | — | — | — | — | |
| Conformer-LType=transducer, Params (M)=118.82023.10 | 2.1 | — | — | — | — | |
| Kimi-Audio2025.12 | 2.1 | — | — | — | — | |
| BaselineModel=Whisper large-v32026.06 | 2.11 | — | — | — | — | |
| Kimi-Audio-Instruct2025.12 | 2.13 | — | — | — | — | |
| E-Branchformer-LType=CTC/AED, Params (M)=148.9, GFLOPs=284.42023.10 | 2.14 | — | — | — | — | |
| E-Branchformer (L), hybridType=AR, Params=149M, Language Model (LM) usage=without LM, Decoding beam size=602025.09 | 2.14 | — | — | — | — | |
| Calm-Whisper (fine-tuned)Model=Whisper large-v3, Protocol=fine-tuned2026.06 | 2.19 | — | — | — | — | |
| Zipformer-MType=pruned transducer, Params (M)=65.6, GFLOPs=62.92023.10 | 2.21 | — | — | — | — | |
| UMA-Split (L)Type=NAR, Params=149M, Language Model (LM) usage=without LM2025.09 | 2.22 | — | — | — | — | |
| FlexiSLM-7B-Stage2In FR=12.5, Out FR=12.52026.06 | 2.26 | — | — | — | — | |
| FlexiSLM-7B-Stage2In FR=12.5, Out FR=6.252026.06 | 2.26 | — | — | — | — | |
| Conformer in ESPnetType=CTC/AED, Params (M)=113.22023.10 | 2.29 | — | — | — | — | |
| Conformer-MType=transducer, Params (M)=30.72023.10 | 2.3 | — | — | — | — | |
| SAE steering (32 layer)Model=Whisper large-v3, Layer=322026.06 | 2.38 | — | — | — | — | |
| Qwen2.5-Omni-7BIn FR=25, Out FR=502026.06 | 2.38 | — | — | — | — | |
| BranchformerType=CTC/AED, Params (M)=116.2, GFLOPs=238.32023.10 | 2.4 | — | — | — | — | |
| Zipformer-SType=pruned transducer, Params (M)=23.3, GFLOPs=40.82023.10 | 2.42 | — | — | — | — | |
| Conformer-L (pruned)Type=pruned transducer, Params (M)=122.5, GFLOPs=294.22023.10 | 2.46 | — | — | — | — | |
| Squeezeformer-LType=CTC, Params (M)=236.3, GFLOPs=333.72023.10 | 2.47 | — | — | — | — | |
| E-Branchformer-BType=CTC/AED, Params (M)=41.1, GFLOPs=78.12023.10 | 2.49 | — | — | — | — | |
| E-Branchformer (B), hybridType=AR, Params=41M, Language Model (LM) usage=without LM, Decoding beam size=602025.09 | 2.49 | — | — | — | — | |
| OriginalGeneration Method=Ground-truth audio2022.09 | 2.5 | 80 | — | — | — | |
| UMA-Split (B)Type=NAR, Params=41M, Language Model (LM) usage=without LM2025.09 | 2.5 | — | — | — | — | |
| Zipformer-L, CTCType=NAR, Params=147M, Language Model (LM) usage=without LM2025.09 | 2.5 | — | — | — | — | |
| Zipformer-M, CTCType=NAR, Params=64M, Language Model (LM) usage=without LM2025.09 | 2.52 | — | — | — | — | |
| FlexiSLM-7B-Stage3In FR=6.25, Out FR=12.52026.06 | 2.55 | — | — | — | — | |
| FlexiSLM-7B-Stage3In FR=6.25, Out FR=6.252026.06 | 2.55 | — | — | — | — | |
| Squeezeformer-MType=CTC, Params (M)=55.6, GFLOPs=88.42023.10 | 2.56 | — | — | — | — | |
| CTC Infer w/o AED headType=NAR, Params=119M, Language Model (LM) usage=without LM2025.09 | 2.59 | — | — | — | — | |
| Reconstruction with SoundStreamGeneration Method=Reconstruction using SoundStream codec2022.09 | 2.6 | 90 | — | — | — | |
| Squeezeformer-MLType=CTC, Params (M)=125.1, GFLOPs=183.32023.10 | 2.61 | — | — | — | — | |
| E-Branchformer, SC-CTCType=NAR, Params=43M, Language Model (LM) usage=without LM2025.09 | 2.62 | — | — | — | — | |
| Conformer in WeNetType=CTC/AED, Params (M)=121.32023.10 | 2.66 | — | — | — | — | |
| FlexiSLM-7B-Stage2In FR=6.25, Out FR=12.52026.06 | 2.68 | — | — | — | — | |
| FlexiSLM-7B-Stage2In FR=6.25, Out FR=6.252026.06 | 2.68 | — | — | — | — | |
| Conformer-SType=transducer, Params (M)=10.32023.10 | 2.7 | — | — | — | — | |
| Squeezeformer-SMType=CTC, Params (M)=28.2, GFLOPs=47.62023.10 | 2.79 | — | — | — | — | |
| w/ MoE (no modality grouping, top-2)Backbone=Conformer, # Active Params=113M2026.02 | 2.8 | — | — | — | — | |
| w/ MoE, modality-aware (top-1 per modality)Backbone=Conformer, # Active Params=113M2026.02 | 2.8 | — | — | — | — | |
| GLM-4-Voice-9BIn FR=12.5, Out FR=12.52026.06 | 2.82 | — | — | — | — | |
| Conformer-M (pruned)Type=pruned transducer, Params (M)=28.4, GFLOPs=77.02023.10 | 2.96 | — | — | — | — | |
| Paraformer-v2 (L)Type=NAR, Params=120M, Language Model (LM) usage=without LM2025.09 | 3 | — | — | — | — | |
| Gemini 2.5-Pro2026.06 | 3.05 | — | — | — | — | |
| Squeezeformer-SType=CTC, Params (M)=18.6, GFLOPs=33.72023.10 | 3.08 | — | — | — | — | |
| Whisper Medium.enEncoder=24 layers, Decoder=24 layers, Train data (hours)=680,0002026.05 | 3.1 | — | 8.1 | — | — | |
| AED, 17-layer enc / 6-layer decBackbone=Conformer, # Active Params=139M2026.02 | 3.2 | — | — | — | — | |
| Whisper Large-v2Encoder=32 layers, Decoder=32 layers, Train data (hours)=680,0002026.05 | 3.2 | — | 1 | — | — | |
| CTC Infer w/o AED headType=NAR, Params=29M, Language Model (LM) usage=without LM2025.09 | 3.2 | — | — | — | — | |
| Whisper2025.12 | 3.21 | — | — | — | — | |
| Whisper Small.enEncoder=12 layers, Decoder=12 layers, Train data (hours)=680,0002026.05 | 3.3 | — | 12.1 | — | — | |
| FlexiSLM-7B-Stage3In FR=5.0, Out FR=5.02026.06 | 3.34 | — | — | — | — | |
| dec-only 17-layerBackbone=Conformer, # Active Params=113M2026.02 | 3.4 | — | — | — | — | |
| Paraformer-v2 (S)Type=NAR, Params=50M, Language Model (LM) usage=without LM2025.09 | 3.4 | — | — | — | — | |
| WavLM Large# Params=316.6M, Evaluation Protocol=Frozen-encoder, Decoding=Greedy CTC2026.06 | 3.44 | — | — | — | — | |
| MiMo-Audio-7B-Instruct2025.12 | 3.5 | — | — | — | — | |
| WavLM (Mref)Params (M)=94.40, Speed-up=1x2026.01 | 3.5 | — | — | — | — | |
| Calm-Whisper (masking)Model=Whisper large-v3, Protocol=masking2026.06 | 3.57 | — | — | — | — | |
| dec-only 17-layerBackbone=Transformer, # Active Params=64M2026.02 | 3.6 | — | — | — | — | |
| Distil-Large-v2Encoder=32 frozen, Decoder=2 layers, Train data (hours)=21,1702026.05 | 3.6 | — | 25 | — | — | |
| HuBERT Large# Params=316.6M, Evaluation Protocol=Frozen-encoder, Decoding=Greedy CTC2026.06 | 3.62 | — | — | — | — | |
| SAE steering (26+32 layers)Model=Whisper large-v3, Layers=26+322026.06 | 3.7 | — | — | — | — | |
| Squeezeformer-XSType=CTC, Params (M)=9.0, GFLOPs=18.22023.10 | 3.74 | — | — | — | — | |
| Conformer-S (pruned)Type=pruned transducer, Params (M)=9.8, GFLOPs=29.12023.10 | 3.75 | — | — | — | — | |
| wav2vec 2.0 Large# Params=316.6M, Evaluation Protocol=Frozen-encoder, Decoding=Greedy CTC2026.06 | 3.75 | — | — | — | — | |
| data2vec 2.0 BaseLanguage Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 3.8 | — | — | — | — | |
| Distil-Medium.enEncoder=24 frozen, Decoder=2 layers, Train data (hours)=21,1702026.05 | 3.9 | — | 24 | — | — | |
| data2vec BaseLanguage Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 3.9 | — | — | — | — | |
| Activation steeringModel=Whisper large-v32026.06 | 4.11 | — | — | — | — | |
| DinoSRLabeled training amount=100h, Implementation=Original pretrained model2025.12 | 4.2 | — | — | — | — | |
| DinoSRLabeled training amount=100h, Implementation=Re-implementation2025.12 | 4.4 | — | — | — | — | |
| Whisper Base.enEncoder=6 layers, Decoder=6 layers, Train data (hours)=680,0002026.05 | 4.4 | — | 21.5 | — | — | |
| FlexiSLM-7B-Stage3In FR=4.0, Out FR=4.02026.06 | 4.47 | — | — | — | — | |
| DLD (Ours)nDS=12, Params (M)=94.40, Speed-up=1x2026.01 | 4.57 | — | — | — | — | |
| WavLM BaseLanguage Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 4.6 | — | — | — | — | |
| OLIVE-A (Mix+Gain)Language Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 4.6 | — | — | — | — | |
| MingTok-AudioModeling=Unified spoken language modeling2026.05 | 4.62 | — | — | — | — | |
| DLD (Ours)nDS=10, Params (M)=80.22, Speed-up=1.17x2026.01 | 4.66 | — | — | — | — | |
| HuBERT BaseLanguage Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 4.7 | — | — | — | — | |
| OLIVE-A (Mix)Language Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 4.7 | — | — | — | — | |
| data2vec 2.0 BaseLanguage Model=None, Fine-tuning set=train-clean-1002026.06 | 4.8 | — | — | — | — | |
| MR-HuBERT mono-baseLabeled training amount=100h2025.12 | 4.9 | — | — | — | — | |
| wav2vec 2.0 BaseLanguage Model=4-gram LM, Fine-tuning set=train-clean-1002026.06 | 4.9 | — | — | — | — |