Automatic Speech Recognition on LibriSpeech 960h (test-other)
2.5WERw2v-BERT XXL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 2.5 | — | — | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 2.5 | — | — | |
| w2v-Conformer XXL+Unlabeled Data (hrs)=60k, AM Size (B)=1.1, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 2.6 | — | — | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 2.6 | — | — | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 2.7 | — | — | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 2.7 | — | — | |
| w2v-Conformer XXL+Unlabeled Data (hrs)=60k, AM Size (B)=1.1, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 2.7 | — | — | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 2.7 | — | — | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 2.8 | — | — | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 2.8 | — | — | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 2.8 | — | — | |
| HuBERT X-LargeUnlabeled Data (hrs)=60k, AM Size (B)=1.0, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 2.9 | — | — | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 2.9 | — | — | |
| SPEARs+a XLarge# Params=600M, Pre-train data=197k2025.10 | 2.9 | — | — | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 3.1 | — | — | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 3.1 | — | — | |
| WavLM LargeUnlabeled Data=MIX-94k, LM=Transformer2021.10 | 3.2 | — | — | |
| w2v-Conformer XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 3.2 | — | — | |
| wav2vec 2.0 LargeUnlabeled Data=LL-60k, LM=Transformer2021.10 | 3.3 | — | — | |
| HuBERT LargeUnlabeled Data=LL-60k, LM=Transformer2021.10 | 3.3 | — | — | |
| Conformer L with NSTUnlabeled Data (hrs)=60k, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Self-training Only, Decoding Strategy=With LM2021.08 | 3.3 | — | — | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4+, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 3.3 | — | — | |
| HuBERT LargeUnlabeled Data (hrs)=60k, AM Size (B)=0.3, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 3.3 | — | — | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 3.3 | — | — | |
| SPEARs Large# Params=327M, Pre-train data=84k2025.10 | 3.3 | — | — | |
| SPEARs+a Large# Params=327M, Pre-train data=97k2025.10 | 3.4 | — | — | |
| Conformer L with NSTUnlabeled Data (hrs)=60k, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Self-training Only, Decoding Strategy=No LM2021.08 | 3.5 | — | — | |
| w2v-Conformer XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 3.5 | — | — | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 3.5 | — | — | |
| WavLM Large# Params=317M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 3.8 | — | — | |
| Conformer TransducerUnlabeled Data=N/A, LM=LSTM2021.10 | 3.9 | — | — | |
| Conformer LUnlabeled Data (hrs)=N/A, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Trained from Scratch, Decoding Strategy=With LM2021.08 | 3.9 | — | — | |
| SPEARs Base# Params=94M, Pre-train data=84k2025.10 | 4 | — | — | |
| ContextNetUnlabeled Data=N/A, LM=LSTM2021.10 | 4.1 | — | — | |
| Whisper-LDecode=Beam2026.06 | 4.1 | — | — | |
| HuBERT-LTrain=CTC, Decode=Greedy2026.06 | 4.1 | — | — | |
| SPEARs+a Base# Params=94M, Pre-train data=97k2025.10 | 4.2 | — | — | |
| Conformer LUnlabeled Data (hrs)=N/A, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Trained from Scratch, Decoding Strategy=No LM2021.08 | 4.3 | — | — | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 4.4 | — | — | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4+, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 4.5 | — | — | |
| Transf. TransducerUnlabeled Data=N/A, LM=Transf.2021.10 | 4.6 | — | — | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 4.9 | — | — | |
| Branchformer + GFSA#Params=109.8M2023.12 | 4.94 | — | — | |
| Branchformer#Params=109.8M2023.12 | 5 | — | — | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 5.1 | — | — | |
| S2S Transf.Unlabeled Data=N/A, LM=CLM+Transf.2021.10 | 5.2 | — | — | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 5.3 | — | — | |
| WavLM Base +# Params=95M, Pre-train data=94k, fine-tuned from public checkpoint=true2025.10 | 5.4 | — | — | |
| Transformer + GFSA#Params=71.5M2023.12 | 5.49 | — | — | |
| CTC Transf.Unlabeled Data=N/A, LM=CLM+Transf.2021.10 | 5.5 | — | — | |
| Transformer#Params=71.5M2023.12 | 5.5 | — | — | |
| Whisper-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 5.6 | — | — | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 5.6 | — | — | |
| Proposed MethodBias list size (N)=200, Biasing weight (lambda)=4.42025.12 | 5.63 | 17.16 | 5.22 | |
| Proposed MethodBias list size (N)=100, Biasing weight (lambda)=4.42025.12 | 5.64 | 17.22 | 5.22 | |
| Proposed MethodBias list size (N)=500, Biasing weight (lambda)=4.42025.12 | 5.64 | 17.55 | 5.21 | |
| Proposed MethodBias list size (N)=100, Biasing weight (lambda)=1.02025.12 | 5.82 | 21.85 | 5.24 | |
| Proposed MethodBias list size (N)=200, Biasing weight (lambda)=1.02025.12 | 5.82 | 21.85 | 5.24 | |
| Proposed MethodBias list size (N)=500, Biasing weight (lambda)=1.02025.12 | 5.88 | 22.68 | 5.27 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 5.9 | — | — | |
| AED-MTPBias list size (N)=02025.12 | 6 | 30.63 | 5.12 | |
| AED-MTPBias list size (N)=1002025.12 | 6 | 30.63 | 5.12 | |
| AED-MTPBias list size (N)=2002025.12 | 6 | 30.63 | 5.12 | |
| AED-MTPBias list size (N)=5002025.12 | 6 | 30.63 | 5.12 | |
| Baseline (AED)Bias list size (N)=02025.12 | 6.01 | 32.34 | 5.07 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 6.1 | — | — | |
| Proposed MethodBias list size (N)=0, Biasing weight (lambda)=1.02025.12 | 6.25 | 32.4 | 5.32 | |
| Proposed MethodBias list size (N)=0, Biasing weight (lambda)=4.42025.12 | 6.25 | 32.4 | 5.32 | |
| PDS-Base-8Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M2023.05 | 6.38 | — | — | |
| PDS-Base-16Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=114M2023.05 | 6.4 | — | — | |
| Stack-4 (wenet)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=109M2023.05 | 6.7 | — | — | |
| Stack-4 (Baseline)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M2023.05 | 6.72 | — | — | |
| PDS-Base-32Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=119M2023.05 | 6.81 | — | — | |
| CLASBias list size (N)=1002025.12 | 6.89 | 27.81 | 6.14 | |
| CLASBias list size (N)=2002025.12 | 6.89 | 27.59 | 6.15 | |
| CLASBias list size (N)=5002025.12 | 6.93 | 27.92 | 6.18 | |
| CLASBias list size (N)=02025.12 | 6.95 | 28.26 | 6.19 | |
| PDS-Base-16Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M2023.05 | 7.03 | — | — | |
| PDS-Base-32Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=47M2023.05 | 7.12 | — | — | |
| PDS-Base-8Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M2023.05 | 7.2 | — | — | |
| Stack-4 (Baseline)Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=45M2023.05 | 7.29 | — | — | |
| PDS-Base-8Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=75M2023.05 | 7.47 | — | — | |
| AIPAArchitecture=Enc-CTC, Data Augmentation=SpecAugment + AIPA, Auxiliary Loss=InterCTC, Technique=COS2024.06 | 7.51 | — | — | |
| PDS-Deep-8Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M2023.05 | 7.79 | — | — | |
| PDS-Deep-16Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=54M2023.05 | 7.79 | — | — | |
| PDS-Base-16Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=76M2023.05 | 7.85 | — | — | |
| PDS-Base-32Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=82M2023.05 | 7.85 | — | — | |
| PDS-Deep-32Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=55M2023.05 | 7.88 | — | — | |
| Stack-4 (fairseq)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M2023.05 | 7.9 | — | — | |
| Stack-4 (Baseline)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M2023.05 | 7.96 | — | — | |
| Stack-4 (wenet)Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=50M2023.05 | 8.36 | — | — | |
| PDS-Base-8Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M2023.05 | 8.58 | — | — | |
| Stack-4 (Baseline)Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M2023.05 | 8.61 | — | — | |
| Stack-4 (fairseq)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M2023.05 | 9 | — | — | |
| PDS-Base-16Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M2023.05 | 9.02 | — | — | |
| BaselineArchitecture=Enc-CTC, Data Augmentation=SpecAugment, Auxiliary Loss=InterCTC2024.06 | 9.02 | — | — | |
| PDS-Base-32Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=31M2023.05 | 9.31 | — | — | |
| Stack-4 (Baseline)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M2023.05 | 9.42 | — | — |