Automatic Speech Recognition on LibriSpeech 960h (test-clean)
0.016WERSPEARs+a XLarge
Evaluation Results
| Method | Links | |
|---|---|---|
| SPEARs+a XLarge# Params=600M, Pre-train data=197k2025.10 | 0.016 | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=before2020.05 | 0.017 | |
| Noisy Student TrainingBackbone=ContextNet, LM Fusion Stage=after2020.05 | 0.017 | |
| SPEARs Large# Params=327M, Pre-train data=84k2025.10 | 0.017 | |
| SPEARs+a Large# Params=327M, Pre-train data=97k2025.10 | 0.017 | |
| wav2vec 2.0 LargeUnlabeled Data=LL-60k, LM=Transformer2021.10 | 0.018 | |
| WavLM LargeUnlabeled Data=MIX-94k, LM=Transformer2021.10 | 0.018 | |
| WavLM Large# Params=317M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 0.018 | |
| ContextNetTraining Paradigm=Supervised2020.05 | 0.019 | |
| BaselineLanguage Model=Transformer2021.10 | 0.019 | |
| SpeechT5Language Model=Transformer2021.10 | 0.019 | |
| ContextNetUnlabeled Data=N/A, LM=LSTM2021.10 | 0.019 | |
| Conformer TransducerUnlabeled Data=N/A, LM=LSTM2021.10 | 0.019 | |
| HuBERT LargeUnlabeled Data=LL-60k, LM=Transformer2021.10 | 0.019 | |
| SPEARs Base# Params=94M, Pre-train data=84k2025.10 | 0.019 | |
| SPEARs+a Base# Params=94M, Pre-train data=97k2025.10 | 0.019 | |
| Zhang et al.Training Paradigm=Supervised2020.05 | 0.02 | |
| Transf. TransducerUnlabeled Data=N/A, LM=Transf.2021.10 | 0.02 | |
| HuBERT-LTrain=CTC, Decode=Greedy2026.06 | 0.02 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 0.02 | |
| Synnaeve et al.Training Paradigm=Semi-supervised2020.05 | 0.0209 | |
| wav2vec 2.0 BASELanguage Model=Transformer2021.10 | 0.021 | |
| Branchformer + GFSA#Params=109.8M2023.12 | 0.0211 | |
| Branchformer#Params=109.8M2023.12 | 0.0213 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 0.022 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 0.022 | |
| S2S Transf.Unlabeled Data=N/A, LM=CLM+Transf.2021.10 | 0.023 | |
| Whisper-LDecode=Beam2026.06 | 0.023 | |
| Transformer + GFSA#Params=71.5M2023.12 | 0.0231 | |
| Synnaeve et al.Training Paradigm=Supervised2020.05 | 0.0233 | |
| Transformer#Params=71.5M2023.12 | 0.0242 | |
| CTC Transf.Unlabeled Data=N/A, LM=CLM+Transf.2021.10 | 0.025 | |
| wav2vec 2.0 BASELanguage Model=4-gram2021.10 | 0.026 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 0.026 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 0.026 | |
| SpeechT5Language Model=None2021.10 | 0.027 | |
| PDS-Base-16Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=114M, Speedup=1.23x2023.05 | 0.0272 | |
| BaselineLanguage Model=None2021.10 | 0.028 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 0.028 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 0.028 | |
| Stack-4 (Baseline)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M, Speedup=1.00x2023.05 | 0.0282 | |
| WavLM Base +# Params=95M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 0.029 | |
| PDS-Base-32Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=119M, Speedup=1.25x2023.05 | 0.0295 | |
| PDS-Base-16Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M, Speedup=1.14x2023.05 | 0.0299 | |
| Stack-4 (wenet)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=109M2023.05 | 0.03 | |
| PDS-Base-8Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M, Speedup=0.97x2023.05 | 0.0301 | |
| AIPAArchitecture=Enc-CTC, Data Augmentation=SpecAugment + AIPA, Auxiliary Loss=InterCTC, Technique=COS2024.06 | 0.0301 | |
| PDS-Base-8Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M, Speedup=0.97x2023.05 | 0.0303 | |
| PDS-Base-32Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=47M, Speedup=1.20x2023.05 | 0.0304 | |
| Stack-4 (wenet)Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=50M2023.05 | 0.0305 | |
| Baseline (w/o CTC)Language Model=None2021.10 | 0.031 | |
| SpeechT5 (w/o CTC)Language Model=None2021.10 | 0.031 | |
| Stack-4 (Baseline)Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=45M, Speedup=1.00x2023.05 | 0.0321 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 0.033 | |
| PDS-Deep-32Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=55M, Speedup=1.27x2023.05 | 0.0333 | |
| PDS-Base-16Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=76M, Speedup=1.34x2023.05 | 0.0337 | |
| PDS-Deep-16Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=54M, Speedup=1.19x2023.05 | 0.0338 | |
| wav2vec 2.0 BASELanguage Model=None2021.10 | 0.034 | |
| Stack-4 (fairseq)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M2023.05 | 0.034 | |
| PDS-Base-8Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=75M, Speedup=1.08x2023.05 | 0.0347 | |
| PDS-Deep-8Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M, Speedup=1.03x2023.05 | 0.035 | |
| BaselineArchitecture=Enc-CTC, Data Augmentation=SpecAugment, Auxiliary Loss=InterCTC2024.06 | 0.0361 | |
| PDS-Base-32Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=82M, Speedup=1.47x2023.05 | 0.0364 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M, Speedup=1.00x2023.05 | 0.0367 | |
| PDS-Base-16Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=1.14x2023.05 | 0.0374 | |
| PDS-Base-8Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=0.99x2023.05 | 0.0385 | |
| PDS-Base-32Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=31M, Speedup=1.20x2023.05 | 0.0421 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M, Speedup=1.00x2023.05 | 0.0433 | |
| Stack-4 (fairseq)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M2023.05 | 0.044 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=1.00x2023.05 | 0.0449 |