Automatic Speech Recognition on AMI IHM
7.8WERConformerXXL-RNNT-P + Downstream NST
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ConformerXXL-RNNT-P + Downstream NSTTraining Strategy=Noisy Student Training, Filtering=Enabled2021.09 | 7.8 | — | — | — | |
| ConformerXXL-RNNT-PS#Model Type=PS-model (Upstream pseudo-labeled YT-T)2021.09 | 8.3 | — | — | — | |
| ConformerXXL-RNNT-PModel Type=P-model2021.09 | 8.6 | — | — | — | |
| SOTA2021.09 | 9 | — | — | — | |
| ConformerXXL-LibriLightPre-training=Libri-Light2021.09 | 9.5 | — | — | — | |
| ConformerXXL-RNNT-P + Downstream NST (Non-filtered)Training Strategy=Noisy Student Training, Filtering=None2021.09 | 9.8 | — | — | — | |
| Seed-ASR (ML)Language=EN2024.07 | 13.16 | — | — | — | |
| WhisperBackbone=Large V2, Evaluation Protocol=Zero-shot2022.12 | 16.9 | 54.3 | — | — | |
| Whisper Large-v2Language=EN2024.07 | 16.9 | — | — | — | |
| VibeVoice-ASRLatency=370.7s2026.05 | 19.2 | — | 9.4 | 25.7 | |
| WhisperXLatency=38.8s2026.05 | 22.5 | — | 23.6 | 35.5 | |
| wav2vec 2.0Backbone=Large, Language Model=None2022.12 | 37 | — | — | — |