Speech Recognition on ST-AEDS
2WERTLE+TTS
Evaluation Results
| Method | Links | |
|---|---|---|
| TLE+TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2 | |
| TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2.1 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 2.3 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.5 | |
| TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.8 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.8 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.9 | |
| TLEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3 | |
| NoneIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.1 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 3.2 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 3.4 | |
| TLEIn-Domain=LS, Model=Canary-180M-flash2025.09 | 3.5 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.6 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.6 | |
| TLEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 3.8 | |
| TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 4.1 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 4.2 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 4.2 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 4.2 | |
| TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 4.3 | |
| TLEIn-Domain=CV, Model=Canary-180M-flash2025.09 | 4.7 | |
| StandardIn-Domain=CV, Model=Canary-180M-flash2025.09 | 4.9 | |
| ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 5.1 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 5.2 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 5.3 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.5 | |
| SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.1 | |
| TLEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 6.2 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 6.2 | |
| TLEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 6.3 | |
| NoneIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.4 | |
| NoneIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 7.1 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.1 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.2 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 8.5 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 8.7 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 8.9 | |
| SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 9.6 | |
| ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 9.6 | |
| ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 9.9 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 10 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 10.2 | |
| DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 10.4 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 10.4 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 10.9 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 11.3 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 11.9 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 12 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 12.1 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 13.4 | |
| NoneIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 13.7 | |
| DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 14.2 | |
| ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 15.3 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 15.4 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 16.1 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 16.1 | |
| SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 17.3 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 18 | |
| DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 22.2 | |
| StandardIn-Domain=LS, Model=Canary-180M-flash2025.09 | 23.5 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 27.2 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 27.9 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 30.9 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 41.7 | |
| DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 49.2 | |
| SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 52.1 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 52.1 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 72.7 |