Automatic Speech Recognition on Voicebank+Demand
1.71WERWER-OA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| WER-OAASR Model=Parakeet, SE System=Demucs2026.02 | 1.71 | — | — | — | |
| SNR-OA_clipASR Model=Parakeet, SE System=Demucs2026.02 | 1.92 | — | — | — | |
| Classifier-OA_3classASR Model=Parakeet, SE System=Demucs2026.02 | 2.1 | — | — | — | |
| Conf-OAASR Model=Parakeet, SE System=Demucs2026.02 | 2.11 | — | — | — | |
| Noisy yASR Model=Parakeet, SE System=None2026.02 | 2.18 | — | — | — | |
| Conf-SwitchASR Model=Parakeet, SE System=Demucs2026.02 | 2.22 | — | — | — | |
| WER-OAASR Model=Whisper, SE System=Demucs2026.02 | 2.36 | — | — | — | |
| DNSMOS-OAASR Model=Parakeet, SE System=Demucs2026.02 | 2.43 | — | — | — | |
| Classifier-OA_2classASR Model=Parakeet, SE System=Demucs2026.02 | 2.52 | — | — | — | |
| Enhanced x_hatASR Model=Parakeet, SE System=Demucs2026.02 | 2.64 | — | — | — | |
| SNR-OA_no-clipASR Model=Parakeet, SE System=Demucs2026.02 | 2.69 | — | — | — | |
| Classifier-OA_3classASR Model=Whisper, SE System=Demucs2026.02 | 2.76 | — | — | — | |
| Conf-OAASR Model=Whisper, SE System=Demucs2026.02 | 2.76 | — | — | — | |
| SNR-OA_clipASR Model=Whisper, SE System=Demucs2026.02 | 2.94 | — | — | — | |
| Conf-SwitchASR Model=Whisper, SE System=Demucs2026.02 | 3.02 | — | — | — | |
| Noisy yASR Model=Whisper, SE System=None2026.02 | 3.12 | — | — | — | |
| DNSMOS-OAASR Model=Whisper, SE System=Demucs2026.02 | 3.12 | — | — | — | |
| Classifier-OA_2classASR Model=Whisper, SE System=Demucs2026.02 | 3.43 | — | — | — | |
| SNR-OA_no-clipASR Model=Whisper, SE System=Demucs2026.02 | 3.68 | — | — | — | |
| Enhanced x_hatASR Model=Whisper, SE System=Demucs2026.02 | 3.91 | — | — | — | |
| WER-OAASR Model=Wav2Vec2, SE System=Demucs2026.02 | 8.62 | — | — | — | |
| Conf-OAASR Model=Wav2Vec2, SE System=Demucs2026.02 | 9.69 | — | — | — | |
| Conf-SwitchASR Model=Wav2Vec2, SE System=Demucs2026.02 | 9.75 | — | — | — | |
| Classifier-OA_3classASR Model=Wav2Vec2, SE System=Demucs2026.02 | 9.77 | — | — | — | |
| SNR-OA_no-clipASR Model=Wav2Vec2, SE System=Demucs2026.02 | 9.88 | — | — | — | |
| DNSMOS-OAASR Model=Wav2Vec2, SE System=Demucs2026.02 | 9.93 | — | — | — | |
| Classifier-OA_2classASR Model=Wav2Vec2, SE System=Demucs2026.02 | 10.01 | — | — | — | |
| SNR-OA_clipASR Model=Wav2Vec2, SE System=Demucs2026.02 | 10.21 | — | — | — | |
| Enhanced x_hatASR Model=Wav2Vec2, SE System=Demucs2026.02 | 10.63 | — | — | — | |
| Noisy yASR Model=Wav2Vec2, SE System=None2026.02 | 11.39 | — | — | — | |
| Classifier-OA2classSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.31 | 1.3 | 7.71 | |
| Classifier-OA3classSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.37 | 1.57 | 8.28 | |
| Conf-OA (Eq. 3)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.24 | 1.35 | 7.61 | |
| Conf-Switch (Eq. 6)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.01 | 1.26 | 7.64 | |
| DNSMOS-OASpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.36 | 1.6 | 7.88 | |
| Enhanced x̂Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.34 | 1.52 | 8.09 | |
| Noisy ySpeech Enhancement Model=None2026.02 | — | 3.12 | 2.18 | 11.39 | |
| SNR-OAclipSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.51 | 1.69 | 9.12 | |
| SNR-OAno-clipSpeech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 2.4 | 1.79 | 8.01 | |
| WER-OA (Eq. 2)Speech Enhancement Model=GR-KAN-based MPSENet2026.02 | — | 1.55 | 1.03 | 6.56 |