Automatic Speech Recognition on CHiME-4 single-channel (et_simu)
0.056WERWavLM (Weighted-sum) + Joint FT. WavLM
Evaluation Results
| Method | Links | |
|---|---|---|
| WavLM (Weighted-sum) + Joint FT. WavLMDecoding=LM-based, Training=Joint Fine-tuning2026.02 | 0.056 | |
| IRISDecoding=LM-based, Architecture=Conv-TasNet + AED, Backbone=WavLM Large2026.02 | 0.061 | |
| WavLM (Token) + W2T-EDecoding=LM-based, Frontend=W2T-E2026.02 | 0.061 | |
| WavLM (Weighted-sum)Decoding=LM-based, Aggregation=Weighted-sum2026.02 | 0.08 | |
| WavLM (Weighted-sum) + W2W-E (TF-GridNet)Decoding=LM-based, Frontend=W2W-E (TF-GridNet)2026.02 | 0.082 | |
| W2T-ESystem=+ W2T-E, Backend Architecture=Token ASR (AED)2026.02 | 0.082 | |
| W2T-ESystem=+ W2T-E, Backend Architecture=Token ASR (CTC-only)2026.02 | 0.099 | |
| WavLM (Weighted-sum)System=WavLM (Weighted-sum), Backend Architecture=Continuous ASR (AED)2026.02 | 0.11 | |
| W2W-E (TF-GridNet)System=+ W2W-E (TF-GridNet), Backend Architecture=Continuous ASR (AED)2026.02 | 0.112 | |
| V2T-E (E-Branchformer)System=+ V2T-E (E-Branchformer), Backend Architecture=Token ASR (AED)2026.02 | 0.136 | |
| V2T-E (TCN)System=+ V2T-E (TCN), Backend Architecture=Token ASR (AED)2026.02 | 0.137 | |
| V2T-E (MLP)System=+ V2T-E (MLP), Backend Architecture=Token ASR (AED)2026.02 | 0.147 | |
| W2W-E (TF-GridNet)System=+ W2W-E (TF-GridNet), Backend Architecture=Token ASR (AED)2026.02 | 0.151 | |
| W2W-E (Conv-TasNet)System=+ W2W-E (Conv-TasNet), Backend Architecture=Continuous ASR (AED)2026.02 | 0.172 | |
| WavLMSystem=WavLM, Backend Architecture=Token ASR (AED)2026.02 | 0.186 | |
| T2T-ESystem=+ T2T-E, Backend Architecture=Token ASR (AED)2026.02 | 0.186 | |
| W2W-E (Conv-TasNet)System=+ W2W-E (Conv-TasNet), Backend Architecture=Token ASR (AED)2026.02 | 0.216 | |
| WavLMSystem=WavLM, Backend Architecture=Token ASR (CTC-only)2026.02 | 0.236 | |
| FBANKSystem=FBANK, Backend Architecture=Continuous ASR (AED)2026.02 | 0.251 |