Automatic Speech Recognition on FSC Phase-4 (dev)
23.7WERDCA
Evaluation Results
| Method | Links | |
|---|---|---|
| DCASSL Model=WavLM + HuBERT, Fusion Method=Deep Cross-Attention, Total Parameters (M)=676.1, Trainable Parameters (M)=44.1, Encoder Architecture=E-Branchformer2026.04 | 23.7 | |
| Linear Projection+SSL Model=WavLM + HuBERT, Fusion Method=Linear Projection+, Total Parameters (M)=675.8, Trainable Parameters (M)=43.7, Encoder Architecture=E-Branchformer2026.04 | 24.1 | |
| Co-AttentionSSL Model=WavLM + HuBERT, Fusion Method=Co-Attention [20], Total Parameters (M)=668.6, Trainable Parameters (M)=36.5, Encoder Architecture=E-Branchformer2026.04 | 24.3 | |
| Feature Refinement LossSSL Model=WavLM + HuBERT, Fusion Method=+ FRL, Total Parameters (M)=668.5, Trainable Parameters (M)=36.4, Encoder Architecture=E-Branchformer2026.04 | 24.3 | |
| Linear ProjectionSSL Model=WavLM + HuBERT, Fusion Method=Linear Projection, Total Parameters (M)=668.5, Trainable Parameters (M)=36.4, Encoder Architecture=E-Branchformer2026.04 | 24.4 | |
| Weighted-SumSSL Model=WavLM + HuBERT, Fusion Method=Weighted-Sum, Total Parameters (M)=668.5, Trainable Parameters (M)=36.4, Encoder Architecture=E-Branchformer2026.04 | 24.8 | |
| WavLMSSL Model=WavLM, Fusion Method=-, Total Parameters (M)=351.7, Trainable Parameters (M)=36.3, Encoder Architecture=E-Branchformer2026.04 | 24.9 | |
| WavLMArchitecture Components=Enc./Dec.2026.04 | 25.1 | |
| HuBERTArchitecture Components=Enc./Dec.2026.04 | 37 |