Speech Recognition on LibriSpeech clean (dev)
0.0106WERStep-Audio2 Mini
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 0.0106 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 0.0108 | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 0.0113 | — | — | — | — | — | — | — | — | — | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 0.0118 | — | — | — | — | — | — | — | — | — | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 0.0123 | — | — | — | — | — | — | — | — | — | — | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 0.0127 | — | — | — | — | — | — | — | — | — | — | |
| CTC + AEDNum. layers Enc.=24, Num. layers Dec.=8, Text-util.=-2026.04 | 0.0149 | — | — | — | — | — | — | — | — | — | — | |
| CTC + DLMNum. layers Enc.=40, Num. layers Dec.=8, Text-util.=-2026.04 | 0.0149 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 0.0154 | — | — | — | — | — | — | — | — | — | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=TTS+LM2026.04 | 0.0156 | — | — | — | — | — | — | — | — | — | — | |
| CTC + AEDNum. layers Enc.=16, Num. layers Dec.=6, Text-util.=TTS2026.04 | 0.0157 | — | — | — | — | — | — | — | — | — | — | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 0.0163 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 0.0167 | — | — | — | — | — | — | — | — | — | — | |
| CTCNum. layers Enc.=24, Num. layers Dec.=0, Text-util.=-2026.04 | 0.0169 | — | — | — | — | — | — | — | — | — | — | |
| Stateformer 25LParams=139.8M, Framework=Transducer Proposed, External LM=None2023.05 | 0.0176 | — | — | — | — | — | — | — | — | — | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=TTS2026.04 | 0.0176 | — | — | — | — | — | — | — | — | — | — | |
| MH-SSM 32LParams=140.3M, Framework=Transducer Proposed, External LM=None2023.05 | 0.018 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-Audiozero-shot=true2023.11 | 0.018 | — | — | — | — | — | — | — | — | — | — | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | 0.0182 | — | — | — | — | — | — | — | — | — | — | |
| CTC + LMNum. layers Enc.=16, Num. layers Dec.=32, Text-util.=LM2026.04 | 0.0183 | — | — | — | — | — | — | — | — | — | — | |
| CTC + AEDNum. layers Enc.=16, Num. layers Dec.=6, Text-util.=-2026.04 | 0.0184 | — | — | — | — | — | — | — | — | — | — | |
| Parameter ClusteringSparsity=10%, Parameters=1397M, Mixed sparsity=Yes, GFLOPs (Total / Trans.)=2499.16 / 2469.302026.06 | 0.0189 | — | — | — | — | — | — | — | — | — | — | |
| Conformer [11]Params=118.8M, Framework=Transducer, External LM=None2023.05 | 0.019 | — | — | — | — | — | — | — | — | — | — | |
| Conformer 24LParams=133.7M, Framework=Transducer Baseline, External LM=None2023.05 | 0.0195 | — | — | — | — | — | — | — | — | — | — | |
| ContextNetParams=112.7M, Framework=Transducer, External LM=None2023.05 | 0.02 | — | — | — | — | — | — | — | — | — | — | |
| Conformer [41]Params=~120M, Framework=Transducer, External LM=None2023.05 | 0.02 | — | — | — | — | — | — | — | — | — | — | |
| Whisper-large-v3 (Uncompressed)Sparsity=0%, Parameters=1550M, GFLOPs (Total / Trans.)=2773.53 / 2743.662026.06 | 0.0206 | — | — | — | — | — | — | — | — | — | — | |
| SpeechT5Task-specific fine-tuning=true2023.11 | 0.021 | — | — | — | — | — | — | — | — | — | — | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 0.0214 | — | — | — | — | — | — | — | — | — | — | |
| Transformer 36LParams=129.0M, Framework=Transducer Baseline, External LM=None2023.05 | 0.0216 | — | — | — | — | — | — | — | — | — | — | |
| SpeechMamba# Params (M)=67.62026.05 | 0.0216 | — | — | — | — | — | — | — | — | — | — | |
| BranchformerParams=116.2M, Framework=AED, External LM=None2023.05 | 0.022 | — | — | — | — | — | — | — | — | — | — | |
| data2vecLabeled data amount=100 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.022 | — | — | — | — | — | — | — | — | — | — | |
| S4 36LParams=129.6M, Framework=Transducer Baseline, External LM=None2023.05 | 0.0221 | — | — | — | — | — | — | — | — | — | — | |
| CTCNum. layers Enc.=16, Num. layers Dec.=0, Text-util.=-2026.04 | 0.0227 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled data amount=100 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.023 | — | — | — | — | — | — | — | — | — | — | |
| Base Model (SpeechMamba) with naive sparsification# Params (M)=67.62026.05 | 0.023 | — | — | — | 20 | — | — | — | — | — | — | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0232 | — | — | — | — | — | — | — | — | — | — | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0259 | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0Labeled data amount=100 hr, Pre-training steps=400k, Batch size (minutes)=96, Model size=BASE, Language model=4-gram2023.05 | 0.027 | — | — | — | — | — | — | — | — | — | — | |
| HuBERTLabeled data amount=100 hr, Pre-training steps=250k + 400k, Batch size (minutes)=47, Model size=BASE, Language model=4-gram2023.05 | 0.027 | — | — | — | — | — | — | — | — | — | — | |
| Parameter ClusteringSparsity=10%, Parameters=1397M, Mixed sparsity=No, GFLOPs (Total / Trans.)=2499.16 / 2469.302026.06 | 0.0289 | — | — | — | — | — | — | — | — | — | — | |
| E-SpeechMamba# Params (M)=67.62026.05 | 0.029 | — | — | — | 62 | — | — | — | — | — | — | |
| DinoSRLabeled data amount=10 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.031 | — | — | — | — | — | — | — | — | — | — | |
| IML-Spikeformer# Params (M)=99.42026.05 | 0.031 | — | — | — | — | — | — | — | — | — | — | |
| E-SpeechMamba (Optimized)# Params (M)=67.62026.05 | 0.031 | — | — | — | 64 | — | — | — | — | — | — | |
| CYCLE (REV)Enc M=8, Enc N=16, Dec M=4, Dec N=8, #Params=50M, Speed=x1.412021.04 | 0.0311 | — | — | — | — | — | — | — | — | — | — | |
| SEQUENCEEnc M=8, Enc N=16, Dec M=4, Dec N=8, #Params=50M, Speed=x1.412021.04 | 0.0316 | — | — | — | — | — | — | — | — | — | — | |
| CYCLEEnc M=8, Enc N=16, Dec M=4, Dec N=8, #Params=50M, Speed=x1.412021.04 | 0.0328 | — | — | — | — | — | — | — | — | — | — | |
| data2vecLabeled data amount=10 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.033 | — | — | — | — | — | — | — | — | — | — | |
| HuBERT LargeSparsity=0%, #Params=316.6M, GFLOPs (Total / Trans.)=36.25 / 30.44, Fine-tuning=Before2026.06 | 0.0335 | — | — | — | — | — | — | — | — | — | — | |
| HuBERT LargeSparsity=0%, #Params=316.6M, GFLOPs (Total / Trans.)=36.25 / 30.44, Fine-tuning=After2026.06 | 0.0335 | — | — | — | — | — | — | — | — | — | — | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 0.0341 | — | — | — | — | — | — | — | — | — | — | |
| Magnitude pruningSparsity=10%, #Params=282.7M, Mixed sparsity=true, GFLOPs (Total / Trans.)=32.94 / 27.14, Fine-tuning=Before2026.06 | 0.0363 | — | — | — | — | — | — | — | — | — | — | |
| Parameter clusteringSparsity=10%, #Params=282.7M, Mixed sparsity=true, GFLOPs (Total / Trans.)=32.94 / 27.14, Fine-tuning=Before2026.06 | 0.0363 | — | — | — | — | — | — | — | — | — | — | |
| UniversalEnc M=1, Enc N=6, Dec M=1, Dec N=6, #Params=54M, Speed=x1.002021.04 | 0.0373 | — | — | — | — | — | — | — | — | — | — | |
| Parameter ClusteringSparsity=20%, Parameters=1250M, Mixed sparsity=Yes, GFLOPs (Total / Trans.)=2224.80 / 2194.932026.06 | 0.0374 | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0Labeled data amount=10 hr, Pre-training steps=400k, Batch size (minutes)=96, Model size=BASE, Language model=4-gram2023.05 | 0.038 | — | — | — | — | — | — | — | — | — | — | |
| HuBERTLabeled data amount=10 hr, Pre-training steps=250k + 400k, Batch size (minutes)=47, Model size=BASE, Language model=4-gram2023.05 | 0.039 | — | — | — | — | — | — | — | — | — | — | |
| VanillaEnc M=6, Enc N=6, Dec M=6, Dec N=6, #Params=52M, Speed=x2.942021.04 | 0.0398 | — | — | — | — | — | — | — | — | — | — | |
| data2vecLabeled data amount=1 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.04 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled training amount=100h, Implementation=Original pretrained model that we fine-tuned, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.04 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled data amount=1 hr, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.041 | — | — | — | — | — | — | — | — | — | — | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0412 | — | — | — | — | — | — | — | — | — | — | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0413 | — | — | — | — | — | — | — | — | — | — | |
| Parameter clusteringSparsity=10%, #Params=282.7M, Mixed sparsity=false, GFLOPs (Total / Trans.)=32.94 / 27.14, Fine-tuning=Before2026.06 | 0.0413 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled training amount=100h, Implementation=Re-implementation (both pretraining and fine-tuning), Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.042 | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0422 | — | — | — | — | — | — | — | — | — | — | |
| Magnitude pruningSparsity=10%, #Params=282.7M, Mixed sparsity=false, GFLOPs (Total / Trans.)=32.94 / 27.14, Fine-tuning=Before2026.06 | 0.0424 | — | — | — | — | — | — | — | — | — | — | |
| S-SpeechMamba# Params (M)=67.82026.05 | 0.0427 | — | — | — | 72 | — | — | — | — | — | — | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0449 | — | — | — | — | — | — | — | — | — | — | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 0.0455 | — | — | — | — | — | — | — | — | — | — | |
| MR-HuBERT mono-baseLabeled training amount=100h, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.049 | — | — | — | — | — | — | — | — | — | — | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0491 | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0Labeled data amount=1 hr, Pre-training steps=400k, Batch size (minutes)=96, Model size=BASE, Language model=4-gram2023.05 | 0.05 | — | — | — | — | — | — | — | — | — | — | |
| Magnitude PruningSparsity=10%, Parameters=1397M, Mixed sparsity=Yes, GFLOPs (Total / Trans.)=2499.16 / 2469.302026.06 | 0.05 | — | — | — | — | — | — | — | — | — | — | |
| Parameter clusteringSparsity=50%, #Params=164.4M, Mixed sparsity=true, GFLOPs (Total / Trans.)=21.03 / 15.22, Fine-tuning=After2026.06 | 0.05 | — | — | — | — | — | — | — | — | — | — | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0536 | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 0.0538 | — | — | — | — | — | — | — | — | — | — | |
| HuBERTLabeled data amount=1 hr, Pre-training steps=250k + 400k, Batch size (minutes)=47, Model size=BASE, Language model=4-gram2023.05 | 0.056 | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.057 | — | — | — | — | — | — | — | — | — | — | |
| HuBERTLabeled training amount=100h, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.058 | — | — | — | — | — | — | — | — | — | — | |
| wav2vec 2.0Labeled training amount=100h, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.061 | — | — | — | — | — | — | — | — | — | — | |
| SpidRLabeled training amount=100h, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.061 | — | — | — | — | — | — | — | — | — | — | |
| Parameter clusteringSparsity=60%, #Params=131.6M, Mixed sparsity=true, GFLOPs (Total / Trans.)=17.72 / 11.92, Fine-tuning=After2026.06 | 0.0621 | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0635 | — | — | — | — | — | — | — | — | — | — | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 0.0645 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled data amount=10 minutes, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.066 | — | — | — | — | — | — | — | — | — | — | |
| Parameter clusteringSparsity=30%, #Params=223.6M, Mixed sparsity=true, GFLOPs (Total / Trans.)=26.98 / 21.18, Fine-tuning=Before2026.06 | 0.0689 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled training amount=10h, Implementation=Original pretrained model that we fine-tuned, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.071 | — | — | — | — | — | — | — | — | — | — | |
| data2vecLabeled data amount=10 minutes, Pre-training steps=400k, Batch size (minutes)=63, Model size=BASE, Language model=4-gram2023.05 | 0.073 | — | — | — | — | — | — | — | — | — | — | |
| DinoSRLabeled training amount=10h, Implementation=Re-implementation (both pretraining and fine-tuning), Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.073 | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0731 | — | — | — | — | — | — | — | — | — | — | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 0.0742 | — | — | — | — | — | — | — | — | — | — | |
| BaselineParams=42.7M, Compr. Ratio=0%2021.08 | 0.085 | — | 6,154 | — | — | — | — | — | — | — | — | |
| MF BaselineParams=32.3M, Compr. Ratio=35%2021.08 | 0.085 | — | 3,410 | — | — | — | — | — | — | — | — | |
| MR-HuBERT mono-baseLabeled training amount=10h, Pre-training dataset=LibriSpeech 960h, Decoding strategy=greedy, Language model usage=None2025.12 | 0.085 | — | — | — | — | — | — | — | — | — | — | |
| Sparse AmNet LavgParams=45.3M, Compr. Ratio=15%, 80%, Branch Ratios (S/F)=57%/43%2021.08 | 0.086 | — | 681 | — | — | — | — | — | — | — | — | |
| MF AmNet LavgParams=33.0M, Compr. Ratio=35%, 60%, Branch Ratios (S/F)=38%/62%2021.08 | 0.086 | — | 433 | — | — | — | — | — | — | — | — | |
| MF AmNet LamrParams=33.0M, Compr. Ratio=35%, 60%, Branch Ratios (S/F)=23%/77%2021.08 | 0.086 | — | 9 | — | — | — | — | — | — | — | — |