Speech Recognition on EABI
2Word Error Rate (WER)TTS+ILME
Evaluation Results
| Method | Links | |
|---|---|---|
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2.2 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2.2 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.4 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 2.5 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 2.5 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.2 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.2 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 3.3 | |
| TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 3.4 | |
| ILMEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.4 | |
| TLE+TTS+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 3.5 | |
| TLE+TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 3.9 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 3.9 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 4 | |
| ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 4.2 | |
| TTSIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 4.2 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 4.7 | |
| TTSIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 4.8 | |
| SFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 4.9 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.3 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.5 | |
| TTS+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 5.9 | |
| TLEIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 5.9 | |
| TLE+TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.1 | |
| NoneIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.4 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.6 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 6.9 | |
| DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.9 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Model Architecture=Whisper-Medium2025.09 | 6.9 | |
| TTSIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 7.1 | |
| TLE+TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 7.1 | |
| TLEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 7.5 | |
| TTSIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 7.8 | |
| TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 8.2 | |
| TLE+TTS+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 8.2 | |
| TLEIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 8.5 | |
| TLEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 8.6 | |
| NoneIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 9.4 | |
| NoneIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 9.5 | |
| ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 10.1 | |
| SFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 11.3 | |
| TLE+SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 11.5 | |
| TLE+ILMEIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 11.5 | |
| TLE+ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 11.8 | |
| NoneIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 12.5 | |
| TLE+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 13.1 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 13.3 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 15.6 | |
| TLE+TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 16.6 | |
| TTS+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 17.1 | |
| SFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 17.9 | |
| ILMEIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 19.4 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 21.2 | |
| TLE+TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 22 | |
| DFIn-Domain Dataset=CommonVoice, Backbone=Whisper-Large2025.09 | 22.6 | |
| TLE+DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 22.8 | |
| TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 25.4 | |
| TLE+TTS+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 27.7 | |
| SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 32.9 | |
| TLE+DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 36 | |
| DFIn-Domain Dataset=CommonVoice, Model Architecture=Whisper-Medium2025.09 | 39.9 | |
| DFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 40 | |
| TTS+SFIn-Domain Dataset=LibriSpeech, Backbone=Whisper-Large2025.09 | 53.8 |