Automatic Speech Recognition on CHiME-6 (dev)
26WER (%)G-Augment
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| G-AugmentModel Scale=ConformerXXL, Pre-training Data Settings=Any2022.10 | 26 | — | — | — | — | |
| ConformerXXL-RNNT-PPre-training=YT-U, Upstream=SpeechStew2021.09 | 26.2 | — | — | — | — | |
| ConformerXXL-RNNT-PSPre-training=YT-U, Upstream=YT-T2021.09 | 26.2 | — | — | — | — | |
| Previous SOTAModel Scale=ConformerXXL, Pre-training Data Settings=Any2022.10 | 26.2 | — | — | — | — | |
| G-AugmentModel Scale=ConformerXXL, Pre-training Data Settings=Public2022.10 | 30.9 | — | — | — | — | |
| G-AugmentModel Scale=ConformerL, Pre-training Data Settings=Standard2022.10 | 31.7 | — | — | — | — | |
| ConformerXXLPre-training=Libri-Light, Upstream=SpeechStew2021.09 | 31.9 | — | — | — | — | |
| Previous SOTAModel Scale=ConformerXXL, Pre-training Data Settings=Public2022.10 | 31.9 | — | — | — | — | |
| Previous SOTAModel Scale=ConformerL, Pre-training Data Settings=Standard2022.10 | 33.1 | — | — | — | — | |
| Hybrid systemlanguage_model=AWD-LSTM-LM2020.04 | 33.8 | — | — | — | — | |
| ConformerXXL-RNNT-PPre-training=YT-U2021.09 | 35.1 | — | — | — | — | |
| Hybrid systemlanguage_model=n-gram LM2020.04 | 36.8 | — | — | — | — | |
| HMM (SOTA)2021.09 | 36.9 | — | — | — | — | |
| WavLM + HuBERT (DCA)SSL Model=WavLM + HuBERT, Fusion Method=DCA, Total Params (M)=676.5, Trainable Params (M)=44.4, Encoder=E-Branchformer2026.04 | 43 | — | — | — | — | |
| GPU-accelerated GSSCompute Hardware=4 x V100, Channels=all available, Context duration=15s, BSS iterations=202022.12 | 44.2 | 1.3 | 5.3 | 292.2 | 43.1 | |
| Original GSSCompute Hardware=80 x Xeon, Channels=all available, Context duration=15s, BSS iterations=202022.12 | 44.7 | 19.3 | 1,542.6 | 1 | 43.5 | |
| WavLM + HuBERT (LP + FRL, epsilon=0.6)SSL Model=WavLM + HuBERT, Fusion Method=LP + FRL, epsilon (ϵ)=0.6, Total Params (M)=668.9, Trainable Params (M)=36.8, Encoder=E-Branchformer2026.04 | 45.3 | — | — | — | — | |
| WavLMSSL Model=WavLM, Total Params (M)=352.1, Trainable Params (M)=36.7, Encoder=E-Branchformer2026.04 | 45.4 | — | — | — | — | |
| WavLM + HuBERT (LP + FRL, epsilon=0.4)SSL Model=WavLM + HuBERT, Fusion Method=LP + FRL, epsilon (ϵ)=0.4, Total Params (M)=668.9, Trainable Params (M)=36.8, Encoder=E-Branchformer2026.04 | 45.9 | — | — | — | — | |
| WavLM + HuBERT (LP + FRL, epsilon=0.2)SSL Model=WavLM + HuBERT, Fusion Method=LP + FRL, epsilon (ϵ)=0.2, Total Params (M)=668.9, Trainable Params (M)=36.8, Encoder=E-Branchformer2026.04 | 46 | — | — | — | — | |
| WavLM + HuBERT (LP)SSL Model=WavLM + HuBERT, Fusion Method=LP, Total Params (M)=668.9, Trainable Params (M)=36.8, Encoder=E-Branchformer2026.04 | 46.2 | — | — | — | — | |
| WavLM + HuBERT (LP + FRL, epsilon=0.0)SSL Model=WavLM + HuBERT, Fusion Method=LP + FRL, epsilon (ϵ)=0.0, Total Params (M)=668.9, Trainable Params (M)=36.8, Encoder=E-Branchformer2026.04 | 48.4 | — | — | — | — | |
| RNN-Tenhancement=train_gss + dev_gss242020.04 | 49 | — | — | — | — | |
| CHIME-6 TDNN-F baselinemodel=CHIME-6 TDNN-F baseline2020.04 | 51.7 | — | — | — | — | |
| HMM Baseline2021.09 | 51.8 | — | — | — | — | |
| RNN-Tenhancement=train_gss + dev_gss122020.04 | 52.6 | — | — | — | — | |
| WavLM + HuBERT (Co-Attention)SSL Model=WavLM + HuBERT, Fusion Method=Co-Attention [20], Total Params (M)=668.9, Trainable Params (M)=36.9, Encoder=E-Branchformer2026.04 | 54 | — | — | — | — | |
| RNN-Tenhancement=dev_gss122020.04 | 55 | — | — | — | — |