Speech Recognition on EMNS
4.9WERTLE+TTS+ILME
Evaluation Results
| Method | Links | |
|---|---|---|
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 4.9 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 5.2 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.3 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 5.5 | |
| TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 5.6 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 5.7 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 5.8 | |
| TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 6.1 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 6.1 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.3 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.6 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.6 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.8 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 7.2 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 7.4 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 7.7 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.1 | |
| TLEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 8.3 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 8.7 | |
| NoneIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 8.7 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 8.8 | |
| TLEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 9.3 | |
| TLEIn-Domain=LS, Model=Canary-180M-flash2025.09 | 9.4 | |
| TLEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 9.5 | |
| ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 9.6 | |
| SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 10.1 | |
| StandardIn-Domain=CV, Model=Canary-180M-flash2025.09 | 10.4 | |
| TLEIn-Domain=CV, Model=Canary-180M-flash2025.09 | 10.6 | |
| TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 10.8 | |
| TLEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 11.3 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 11.7 | |
| TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 11.8 | |
| NoneIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 11.8 | |
| ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 12.1 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 12.4 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 14 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 14.3 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 14.5 | |
| NoneIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 14.6 | |
| SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 15.2 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 16.1 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 16.6 | |
| NoneIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 16.7 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 16.8 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 16.9 | |
| DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 17 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 17 | |
| ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 17.2 | |
| SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 17.6 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 18.3 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 18.9 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 19 | |
| DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 19.7 | |
| StandardIn-Domain=LS, Model=Canary-180M-flash2025.09 | 20.5 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 21.4 | |
| DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 21.8 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 23.1 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 24.3 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 25.6 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 26.3 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 27.3 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 31.6 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 32.1 | |
| ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 34.3 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 41.6 | |
| DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 72.2 | |
| SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 84.5 |