Automatic Speech Recognition on CHiME-4 (dev-real)
3.2WERWhisper (real label)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Whisper (real label)Adaptation strategy=Finetuning, Supervision type=Supervised2024.05 | 3.2 | — | — | — | |
| W2W-E (TF-GridNet)System=+ W2W-E (TF-GridNet), Backend Architecture=Continuous ASR (AED)2026.02 | 3.8 | — | — | — | |
| STARAdaptation strategy=STAR, Supervision type=Unsupervised2024.05 | 3.9 | — | — | — | |
| TOKreweight (A_t)Adaptation strategy=Self-training, Token-level re-weighting=A_t, Supervision type=Unsupervised2024.05 | 4.1 | — | — | — | |
| UTTfilterAdaptation strategy=Self-training, Filtering=Utterance-level, Supervision type=Unsupervised2024.05 | 4.3 | — | — | — | |
| TOKreweight (G_t)Adaptation strategy=Self-training, Token-level re-weighting=G_t, Supervision type=Unsupervised2024.05 | 4.3 | — | — | — | |
| Whisper (self-train.)Adaptation strategy=Self-training, Supervision type=Unsupervised2024.05 | 4.5 | — | — | — | |
| W2T-ESystem=+ W2T-E, Backend Architecture=Token ASR (AED)2026.02 | 4.5 | — | — | — | |
| Whisper (frozen)Adaptation strategy=None, Supervision type=Zero-shot2024.05 | 4.6 | — | — | — | |
| WavLM (Weighted-sum)System=WavLM (Weighted-sum), Backend Architecture=Continuous ASR (AED)2026.02 | 6 | — | — | — | |
| W2W-E (Conv-TasNet)System=+ W2W-E (Conv-TasNet), Backend Architecture=Continuous ASR (AED)2026.02 | 6 | — | — | — | |
| W2T-ESystem=+ W2T-E, Backend Architecture=Token ASR (CTC-only)2026.02 | 6.1 | — | — | — | |
| W2W-E (TF-GridNet)System=+ W2W-E (TF-GridNet), Backend Architecture=Token ASR (AED)2026.02 | 6.7 | — | — | — | |
| IRTFpost-filter=Wiener2019.05 | 6.76 | — | — | — | |
| MVDRpost-filter=Wiener2019.05 | 6.85 | — | — | — | |
| IRTFpost-filter=none2019.05 | 7.02 | — | — | — | |
| MVDRpost-filter=none2019.05 | 7.03 | — | — | — | |
| V2T-E (E-Branchformer)System=+ V2T-E (E-Branchformer), Backend Architecture=Token ASR (AED)2026.02 | 7.7 | — | — | — | |
| GEVpost-filter=BAN2019.05 | 7.87 | — | — | — | |
| V2T-E (TCN)System=+ V2T-E (TCN), Backend Architecture=Token ASR (AED)2026.02 | 8 | — | — | — | |
| V2T-E (MLP)System=+ V2T-E (MLP), Backend Architecture=Token ASR (AED)2026.02 | 8.8 | — | — | — | |
| W2W-E (Conv-TasNet)System=+ W2W-E (Conv-TasNet), Backend Architecture=Token ASR (AED)2026.02 | 9.5 | — | — | — | |
| Unprocessedpost-filter=none2019.05 | 9.83 | — | — | — | |
| GEVpost-filter=none2019.05 | 10.02 | — | — | — | |
| T2T-ESystem=+ T2T-E, Backend Architecture=Token ASR (AED)2026.02 | 12.1 | — | — | — | |
| WavLMSystem=WavLM, Backend Architecture=Token ASR (AED)2026.02 | 12.6 | — | — | — | |
| FBANKSystem=FBANK, Backend Architecture=Continuous ASR (AED)2026.02 | 15.1 | — | — | — | |
| WavLM (Continuous)SSL=WavLM, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 16 | — | — | — | |
| WavLMSystem=WavLM, Backend Architecture=Token ASR (CTC-only)2026.02 | 16.2 | — | — | — | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 17.8 | — | — | — | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 18.8 | — | — | — | |
| WavLM (Hard Assignment)SSL=WavLM, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 19.3 | — | — | — | |
| WavLM (Soft Training)SSL=WavLM, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 19.4 | — | — | — | |
| WavLM (Hard Assignment)SSL=WavLM, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 20.4 | — | — | — | |
| Posterior-based soft assignment (WavLM)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 25.1 | — | — | — | |
| WavLM (Hard Assignment)SSL=WavLM, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 27.8 | — | — | — | |
| HuBERT (Continuous)SSL=HuBERT, K=-, Train Assign.=cont., Infer Assign.=-2026.06 | 52.7 | — | — | — | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=soft2026.06 | 54.4 | — | — | — | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=4096, Train Assign.=hard, Infer Assign.=hard2026.06 | 56.3 | — | — | — | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=soft2026.06 | 56.5 | — | — | — | |
| HuBERT (Soft Training)SSL=HuBERT, K=1024, Train Assign.=soft, Infer Assign.=soft2026.06 | 56.6 | — | — | — | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=1024, Train Assign.=hard, Infer Assign.=hard2026.06 | 59 | — | — | — | |
| Posterior-based soft assignment (HuBERT)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=soft2026.06 | 59.9 | — | — | — | |
| HuBERT (Hard Assignment)SSL=HuBERT, K=128, Train Assign.=hard, Infer Assign.=hard2026.06 | 63.4 | — | — | — | |
| Classifier-OA2classSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 12.88 | 11.87 | 27.73 | |
| Classifier-OA3classSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 6.18 | 5.37 | 24.85 | |
| Conf-OA (Eq. 3)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 5.86 | 5.55 | 24.03 | |
| Conf-Switch (Eq. 6)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 7.55 | 6.07 | 28.58 | |
| DNSMOS-OASpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 11.56 | 9.75 | 26.26 | |
| Enhanced x̂Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 15.75 | 14.72 | 30.91 | |
| Noisy ySpeech Enhancement Model=None2026.02 | — | 6.48 | 6.22 | 42.24 | |
| WER-OA (Eq. 2)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 5.36 | 4.85 | 23.43 |