Automatic Speech Recognition on LibriSpeech 100h (test-other)
4.6Word Error RateSPEARs+a XLarge
Evaluation Results
| Method | Links | |
|---|---|---|
| SPEARs+a XLarge# Params=600M, Pre-train data=197k2025.10 | 4.6 | |
| SPEARs Large# Params=327M, Pre-train data=84k2025.10 | 4.7 | |
| SPEARs+a Large# Params=327M, Pre-train data=97k2025.10 | 4.8 | |
| WavLM (Continuous)SSL=WavLM, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 5.5 | |
| SPEARs Base# Params=94M, Pre-train data=84k2025.10 | 5.7 | |
| HuBERT (Continuous)SSL=HuBERT, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 5.7 | |
| SPEARs+a Base# Params=94M, Pre-train data=97k2025.10 | 6 | |
| WavLM Large# Params=317M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 6.1 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 6.3 | |
| WavLM (Soft Training)SSL=WavLM, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 6.6 | |
| WavLM (Hard Assignment)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 6.6 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 6.8 | |
| ASR-onlyToken Category=Single-task Optimized, alpha (α)=02026.01 | 7 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 7 | |
| Discrete WavLMToken Category=Baseline (phonetic)2026.01 | 7.1 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 7.1 | |
| HuBERT (Soft Training)SSL=HuBERT, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 7.2 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 7.3 | |
| WavLM (Hard Assignment)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 7.4 | |
| USAD Large# Params=330M, Pre-train data=126k, fine-tuned from public checkpoint=true2025.10 | 7.7 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 7.7 | |
| WavLM Base +# Params=95M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 8.4 | |
| Phonological TokenizerToken Category=Proposed, alpha (α)=0.12026.01 | 8.5 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=Joint, Decode=S2T2026.06 | 9.2 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=Joint, Decode=PF-S2T2026.06 | 9.3 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=S2T, Decode=S2T2026.06 | 9.4 | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 10.2 | |
| Whisper-M + Llama 8B (4bit, r=4)Train=PF-S2T, Decode=PF-S2T2026.06 | 10.5 | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 11.1 | |
| WavLM (Hard Assignment)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 11.3 | |
| USAD Base# Params=94M, Pre-train data=126k, fine-tuned from public checkpoint=true2025.10 | 11.4 | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 12.2 | |
| Whisper-MTrain=–, Decode=Beam2026.06 | 12.2 | |
| SPEARa Large# Params=327M, Pre-train data=13k2025.10 | 18.6 | |
| Branchformer + GFSA#Params=109.8M2023.12 | 22.25 | |
| Branchformer#Params=109.8M2023.12 | 22.43 | |
| SPEARa Base# Params=94M, Pre-train data=13k2025.10 | 23 | |
| SpeechTokenizerToken Category=Baseline (hybrid)2026.01 | 23.5 | |
| Transformer + GFSA#Params=71.5M2023.12 | 24.3 | |
| Transformer#Params=71.5M2023.12 | 25.42 | |
| Voc-onlyToken Category=Single-task Optimized, alpha (α)=12026.01 | 27.7 | |
| WavTokenizerToken Category=Baseline (acoustic)2026.01 | 96.8 |