Automatic Speech Recognition on LibriSpeech 100h (test-clean)
2.4WERSpeechT5
Evaluation Results
| Method | Links | |
|---|---|---|
| SpeechT5LM=Transformer2021.10 | 2.4 | |
| SPEARs+a XLarge# Params=600M, Pre-train data=197k2025.10 | 2.4 | |
| BaselineLM=Transformer2021.10 | 2.5 | |
| wav2vec 2.0 BASELM=Transformer2021.10 | 2.6 | |
| SPEARs Large# Params=327M, Pre-train data=84k2025.10 | 2.6 | |
| SPEARs+a Large# Params=327M, Pre-train data=97k2025.10 | 2.6 | |
| WavLM Large# Params=317M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 3 | |
| SPEARs Base# Params=94M, Pre-train data=84k2025.10 | 3 | |
| WavLM (Continuous)SSL=WavLM, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 3 | |
| SPEARs+a Base# Params=94M, Pre-train data=97k2025.10 | 3.1 | |
| HuBERT (Continuous)SSL=HuBERT, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 3.1 | |
| wav2vec 2.0 BASELM=4-gram2021.10 | 3.4 | |
| HuBERT BASELM=4-gram2021.10 | 3.4 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 3.7 | |
| WavLM (Hard Assignment)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 3.8 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 3.9 | |
| WavLM (Soft Training)SSL=WavLM, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 3.9 | |
| ASR-onlyToken Category=Single-task Optimized, alpha (α)=02026.01 | 4 | |
| WavLM Base +# Params=95M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 4 | |
| USAD Large# Params=330M, Pre-train data=126k, fine-tuned from public checkpoint=true2025.10 | 4 | |
| HuBERT (Soft Training)SSL=HuBERT, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 4 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 4 | |
| NST with LM FusionSupervision=Semi-supervised, NST=true, LM Fusion=true2020.05 | 4.2 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 4.2 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 4.2 | |
| Discrete WavLMToken Category=Baseline (phonetic)2026.01 | 4.3 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 4.3 | |
| WavLM (Hard Assignment)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 4.3 | |
| SpeechT5Joint CTC/Attention=true2021.10 | 4.4 | |
| NST before LM FusionSupervision=Semi-supervised, NST=true, LM Fusion=false2020.05 | 4.5 | |
| DiscreteBERTLM=4-gram2021.10 | 4.5 | |
| Phonological TokenizerToken Category=Proposed, alpha (α)=0.12026.01 | 4.6 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=Joint, Decode=PF-S2T2026.06 | 4.6 | |
| Ling et al.Supervision=Semi-supervised (w/ LibriSpeech 860h)2020.05 | 4.74 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=Joint, Decode=S2T2026.06 | 4.8 | |
| USAD Base# Params=94M, Pre-train data=126k, fine-tuned from public checkpoint=true2025.10 | 4.9 | |
| BaselineJoint CTC/Attention=true2021.10 | 5 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=PF-S2T, Decode=PF-S2T2026.06 | 5 | |
| Baseline (LAS + SpecAugment)Supervision=Supervised, SpecAugment=true2020.05 | 5.5 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=S2T, Decode=S2T2026.06 | 5.6 | |
| Hsu et al.Supervision=Semi-supervised (w/ LibriSpeech 860h)2020.05 | 5.78 | |
| Kahn et al.Supervision=Semi-supervised (w/ LibriSpeech 860h)2020.05 | 5.79 | |
| Lüscher et al.Supervision=Supervised2020.05 | 5.8 | |
| HuBERT BASE2021.10 | 5.8 | |
| SpeechT5Joint CTC/Attention=false2021.10 | 5.8 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 5.9 | |
| Ling et al.Supervision=Supervised2020.05 | 6.1 | |
| wav2vec 2.0 BASE2021.10 | 6.1 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 6.1 | |
| BaselineJoint CTC/Attention=false2021.10 | 6.2 | |
| WavLM (Hard Assignment)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 6.4 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 6.7 | |
| Whisper-MTrain=–, Decode=Beam2026.06 | 7.3 | |
| SPEARa Large# Params=327M, Pre-train data=13k2025.10 | 7.4 | |
| Kahn et al.Supervision=Supervised2020.05 | 8.06 | |
| SpeechTokenizerToken Category=Baseline (hybrid)2026.01 | 9.3 | |
| Branchformer + GFSA#Params=109.8M2023.12 | 9.6 | |
| Branchformer#Params=109.8M2023.12 | 9.63 | |
| Transformer + GFSA#Params=71.5M2023.12 | 10.3 | |
| Voc-onlyToken Category=Single-task Optimized, alpha (α)=12026.01 | 10.4 | |
| Transformer#Params=71.5M2023.12 | 11.02 | |
| SPEARa Base# Params=94M, Pre-train data=13k2025.10 | 11.2 | |
| Hsu et al.Supervision=Supervised2020.05 | 14.85 | |
| WavTokenizerToken Category=Baseline (acoustic)2026.01 | 96.7 |