Automatic Speech Recognition on LibriSpeech 80 (test-clean)
1.6WERQwen2-Audio
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-AudioModel category=ASR-Experts, Evaluation engine=Whisper-large-v32026.03 | 1.6 | |
| Qwen3-ASR-1.7BModel category=ASR-Experts, Evaluation engine=Whisper-large-v32026.03 | 1.6 | |
| MinMoModel category=ASR-Experts, Evaluation engine=Whisper-large-v32026.03 | 1.7 | |
| MiniCPM-o-2.6Model category=Perception-centric, Evaluation engine=Whisper-large-v32026.03 | 1.7 | |
| Qwen2.5-Omni-7BModel category=Perception-centric, Evaluation engine=Whisper-large-v32026.03 | 1.8 | |
| HyperCLOVAX-8B-OmniModel category=Unified, Evaluation engine=Whisper-large-v32026.03 | 1.9 | |
| SpeechVerseModel category=ASR-Experts, Evaluation engine=Whisper-large-v32026.03 | 2.1 | |
| Dynin-OmniModel category=Unified, Evaluation engine=Whisper-large-v3, block size=16, diffusion steps=1282026.03 | 2.1 | |
| VITA-1.5Model category=Perception-centric, Evaluation engine=Whisper-large-v32026.03 | 3 | |
| OpenOmniModel category=Perception-centric, Evaluation engine=Whisper-large-v32026.03 | 3.1 | |
| NExT-OMNIModel category=Unified, Evaluation engine=Whisper-large-v3, support for video generation=true2026.03 | 3.1 | |
| EMOVA-7BModel category=Perception-centric, Evaluation engine=Whisper-large-v32026.03 | 4 | |
| AnyGPTModel category=Unified, Evaluation engine=Whisper-large-v32026.03 | 8.5 |