Automatic Speech Recognition on SWITCHBOARD swbd
4.3WERSOTA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SOTA2021.09 | 4.3 | — | |
| ConformerXXL-RNNT-P + Downstream NST2021.09 | 4.5 | — | |
| ConformerXXL-RNNT-P2021.09 | 4.6 | — | |
| ConformerXXL-LibriLight2021.09 | 4.8 | — | |
| ConformerXXL-RNNT-PS#2021.09 | 4.8 | — | |
| NeMoCategory=Candidate Model2026.06 | 5.16 | — | |
| ConformerXXL-RNNT-P + Downstream NST (Non-filtered)2021.09 | 5.2 | — | |
| READCombination Strategy=Sentence-level2026.06 | 5.23 | — | |
| READCombination Strategy=Segment-level2026.06 | 5.53 | — | |
| CombinationLanguage Model=Neural LM2016.09 | 6.2 | — | |
| Best single-systemSNR=20dB2026.06 | 6.26 | — | |
| READ (Segment-level combination)SNR=20dB2026.06 | 6.36 | — | |
| Saon et al. CombinationLanguage Model=Neural LM2016.09 | 6.6 | — | |
| ResNetLanguage Model=Neural LM2016.09 | 6.9 | — | |
| LACELanguage Model=Neural LM2016.09 | 7.1 | — | |
| ResNet GMM alignmentLanguage Model=Neural LM2016.09 | 7.3 | — | |
| CombinationLanguage Model=N-gram LM2016.09 | 7.4 | — | |
| 27k Senone BLSTMLanguage Model=Neural LM2016.09 | 7.5 | — | |
| Saon et al. CombinationLanguage Model=N-gram LM2016.09 | 7.6 | — | |
| VGGLanguage Model=Neural LM2016.09 | 7.6 | — | |
| BLSTMLanguage Model=Neural LM2016.09 | 7.8 | — | |
| 300h ResNetLanguage Model=Neural LM, Training Data=300 hours2016.09 | 8.2 | — | |
| LACELanguage Model=N-gram LM2016.09 | 8.3 | — | |
| Povey et al. LSTMLanguage Model=N-gram LM2016.09 | 8.5 | — | |
| ResNetLanguage Model=N-gram LM2016.09 | 8.6 | — | |
| READCombination Strategy=ROVER integrated with segment-level combination2026.06 | 8.65 | — | |
| 27k Senone BLSTMLanguage Model=N-gram LM2016.09 | 8.7 | — | |
| Kaldi (s5)token=BPE2019.09 | 8.8 | — | |
| ResNet GMM alignmentLanguage Model=N-gram LM2016.09 | 8.8 | — | |
| ESPnet Transformertoken=BPE2019.09 | 9 | — | |
| Saon et al. LSTMLanguage Model=N-gram LM2016.09 | 9 | — | |
| BLSTMLanguage Model=N-gram LM2016.09 | 9 | — | |
| VGGLanguage Model=N-gram LM2016.09 | 9.1 | — | |
| READ (Segment-level combination)SNR=10dB2026.06 | 9.71 | — | |
| Whisper (real label)Adaptation strategy=Finetuning, Supervision type=Supervised2024.05 | 9.9 | — | |
| 300h ResNetLanguage Model=N-gram LM, Training Data=300 hours2016.09 | 10 | — | |
| ROVERSNR=20dB2026.06 | 10.3 | — | |
| ROVERStrategy=ROVER baseline2026.06 | 10.36 | — | |
| Best single-systemSNR=10dB2026.06 | 11.21 | — | |
| STARAdaptation strategy=STAR, Supervision type=Unsupervised2024.05 | 11.7 | — | |
| TOKreweight (A_t)Adaptation strategy=Self-training, Token-level re-weighting=A_t, Supervision type=Unsupervised2024.05 | 11.9 | — | |
| TOKreweight (G_t)Adaptation strategy=Self-training, Token-level re-weighting=G_t, Supervision type=Unsupervised2024.05 | 12.3 | — | |
| Whisper large-v3Category=Candidate Model2026.06 | 12.57 | — | |
| ROVERSNR=10dB2026.06 | 12.62 | — | |
| UTTfilterAdaptation strategy=Self-training, Filtering=Utterance-level, Supervision type=Unsupervised2024.05 | 12.7 | — | |
| Qwen2.5-OmniCategory=Candidate Model2026.06 | 12.78 | — | |
| ClozeGERBackbone=LLaMA-2-7b, Source Speech=false, LoRA=true, Logits Calibration=true, Post-processing=true2024.05 | 12.9 | 21.3 | |
| Whisper (self-train.)Adaptation strategy=Self-training, Supervision type=Unsupervised2024.05 | 13 | — | |
| ClozeGERBackbone=SpeechGPT, Source Speech=true, LoRA=true, Logits Calibration=true, Post-processing=true2024.05 | 13.3 | 18.9 | |
| Whisper (frozen)Adaptation strategy=None, Supervision type=Zero-shot2024.05 | 13.3 | — | |
| Whisper mediumCategory=Candidate Model2026.06 | 14.53 | — | |
| ESPnet RNNtoken=BPE2019.09 | 15.6 | — | |
| Whisper Baseline2024.05 | 16.4 | — | |
| READ (Segment-level combination)SNR=0dB2026.06 | 21.79 | — | |
| Best single-systemSNR=0dB2026.06 | 23.1 | — | |
| ROVERSNR=0dB2026.06 | 27.9 | — |