Speech Recognition on EmoV-DB
4WERTLE+TTS+ILME
Evaluation Results
| Method | Links | |
|---|---|---|
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 4 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 4.6 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 4.8 | |
| TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.5 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 5.8 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.3 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 6.4 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.9 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 7.4 | |
| TLEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 7.5 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 7.6 | |
| TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 7.9 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.2 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.4 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 8.4 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 8.5 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 8.6 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 9 | |
| TLEIn-Domain=LS, Model=Canary-180M-flash2025.09 | 9.3 | |
| NoneIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 9.6 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 9.7 | |
| ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 10.1 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 10.1 | |
| StandardIn-Domain=CV, Model=Canary-180M-flash2025.09 | 10.3 | |
| SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 10.5 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 10.6 | |
| TLEIn-Domain=CV, Model=Canary-180M-flash2025.09 | 10.6 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 10.8 | |
| NoneIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 11.6 | |
| TLEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 11.8 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 11.8 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 12.7 | |
| ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 12.7 | |
| TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 13.5 | |
| TLEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 13.7 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 14 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 16.8 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 17.2 | |
| DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 17.4 | |
| TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 17.5 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 17.6 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 17.8 | |
| SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 18.4 | |
| ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 19 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 20 | |
| TLEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 20.2 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 20.4 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 21.3 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 22.8 | |
| NoneIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 23.1 | |
| SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 23.7 | |
| DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 24.1 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 25.2 | |
| NoneIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 26.4 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 26.9 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 28 | |
| ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 28.1 | |
| DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 33.4 | |
| StandardIn-Domain=LS, Model=Canary-180M-flash2025.09 | 35.9 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 39.7 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 44.6 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 54.5 | |
| DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 58.6 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 58.6 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 61.4 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 65.1 | |
| SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 69.8 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 84.7 |