Automatic Speech Recognition on LibriSpeech 960h clean (dev)
1.9WERHuBERT-L
Evaluation Results
| Method | Links | |
|---|---|---|
| HuBERT-LTrain=CTC, Decode=Greedy2026.06 | 1.9 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 2 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=S2T2026.06 | 2.3 | |
| Whisper-LDecode=Beam2026.06 | 2.4 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 2.6 | |
| PDS-Base-32Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=119M, Speedup=1.25x, Beam size=5, Batch size=50k2023.05 | 2.7 | |
| PDS-Base-8Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M, Speedup=0.97x, Beam size=5, Batch size=50k2023.05 | 2.72 | |
| PDS-Base-16Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=114M, Speedup=1.23x, Beam size=5, Batch size=50k2023.05 | 2.73 | |
| Stack-4 (Baseline)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=113M, Speedup=1.00x, Beam size=5, Batch size=50k2023.05 | 2.77 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=Joint, Decode=PF-S2T2026.06 | 2.8 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 2.8 | |
| PDS-Base-8Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M, Speedup=0.97x, Beam size=5, Batch size=100k2023.05 | 2.87 | |
| Stack-4 (wenet)Architecture=Conformer, Group=E, L=12, dh=512, dff=2048, h=8, #Params=109M, Implementation source=wenet [5], Beam size=5, Batch size=50k2023.05 | 2.9 | |
| AIPAArchitecture=Enc-CTC, Data Augmentation=SpecAugment + AIPA, Auxiliary Loss=InterCTC, Technique=COS2024.06 | 2.91 | |
| PDS-Base-16Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=46M, Speedup=1.14x, Beam size=5, Batch size=100k2023.05 | 2.93 | |
| PDS-Base-32Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=47M, Speedup=1.20x, Beam size=5, Batch size=100k2023.05 | 2.95 | |
| HuBERT-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 3 | |
| Stack-4 (Baseline)Architecture=Conformer, Group=D, L=12, dh=256, dff=2048, h=4, #Params=45M, Speedup=1.00x, Beam size=5, Batch size=100k2023.05 | 3.02 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=S2T, Decode=S2T2026.06 | 3.1 | |
| Whisper-L + Llama 8B (4bit, r=32)Train=PF-S2T, Decode=PF-S2T2026.06 | 3.1 | |
| PDS-Deep-16Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=54M, Speedup=1.19x, Beam size=5, Batch size=100k2023.05 | 3.15 | |
| PDS-Base-8Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=75M, Speedup=1.08x, Beam size=5, Batch size=100k2023.05 | 3.17 | |
| Stack-4 (fairseq)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M, Implementation source=fairseq [4], Beam size=5, Batch size=100k2023.05 | 3.2 | |
| PDS-Deep-32Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=55M, Speedup=1.27x, Beam size=5, Batch size=100k2023.05 | 3.26 | |
| PDS-Base-32Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=82M, Speedup=1.47x, Beam size=5, Batch size=100k2023.05 | 3.32 | |
| PDS-Base-16Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=76M, Speedup=1.34x, Beam size=5, Batch size=100k2023.05 | 3.34 | |
| PDS-Deep-8Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M, Speedup=1.03x, Beam size=5, Batch size=100k2023.05 | 3.34 | |
| BaselineArchitecture=Enc-CTC, Data Augmentation=SpecAugment, Auxiliary Loss=InterCTC2024.06 | 3.47 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=B, L=12, dh=512, dff=2048, h=8, #Params=71M, Speedup=1.00x, Beam size=5, Batch size=100k2023.05 | 3.53 | |
| PDS-Base-8Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=0.99x, Beam size=5, Batch size=100k2023.05 | 3.57 | |
| PDS-Base-16Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=1.14x, Beam size=5, Batch size=100k2023.05 | 3.71 | |
| Stack-4 (fairseq)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Implementation source=fairseq [4], Beam size=5, Batch size=100k2023.05 | 3.8 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=C, L=30, dh=256, dff=2048, h=4, #Params=53M, Speedup=1.00x, Beam size=5, Batch size=100k2023.05 | 3.8 | |
| Stack-4 (Baseline)Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=30M, Speedup=1.00x, Beam size=5, Batch size=100k2023.05 | 3.88 | |
| PDS-Base-32Architecture=Transformer, Group=A, L=12, dh=256, dff=2048, h=4, #Params=31M, Speedup=1.20x, Beam size=5, Batch size=100k2023.05 | 4.13 |