Speech Recognition on VoxPopuli (test)
5.39WERFC-XXL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 5.39 | — | |
| FC-XXLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 5.56 | — | |
| Llama 3 70BParameters=70B2024.07 | 5.7 | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set2023.05 | 5.74 | — | |
| Phi-4-MMModel Type=Omni-LLM2026.01 | 5.93 | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 5.96 | — | |
| ASR + DLMSystem=ASR + DLM2025.12 | 5.99 | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Parakeet-tdt-0.6b-v32026.01 | 6.02 | — | |
| FC-XLDecoder=RNNT, Train Dataset=ASR Set ++2023.05 | 6.05 | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 6.08 | — | |
| FC-XLDecoder=CTC, Train Dataset=ASR Set2023.05 | 6.09 | — | |
| Llama 3 8BParameters=8B2024.07 | 6.2 | — | |
| OursModel Size=2.3B2026.04 | 6.22 | — | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 6.22 | — | |
| ASR + LMSystem=ASR + LM2025.12 | 6.3 | — | |
| Canary-1b-v2Model Type=ASR model2026.01 | 6.35 | — | |
| FC-XXLDecoder=CTC, Train Dataset=ASR Set2023.05 | 6.45 | — | |
| ASR onlySystem=ASR only2025.12 | 6.46 | — | |
| Parakeet-tdt-0.6b-v3Model Type=ASR model2026.01 | 6.48 | — | |
| Speech-HandsFramework=Qwen2.5-Omni, External Reference=Whisper-v2-large2026.01 | 6.49 | — | |
| FC-XXLDecoder=CTC, Train Dataset=ASR Set ++2023.05 | 6.53 | — | |
| Qwen2.5_omniModel Type=Omni-LLM2026.01 | 6.59 | — | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 6.75 | — | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 6.75 | — | |
| FC-XLDecoder=CTC, Train Dataset=ASR Set ++2023.05 | 7 | — | |
| WhisperVersion=v22024.07 | 7 | — | |
| SeamlessM4T v22024.07 | 7 | — | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 7.42 | — | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 7.42 | — | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Parakeet-tdt-0.6b-v32026.01 | 7.49 | — | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Whisper-v2-large2026.01 | 7.53 | — | |
| Whisper-v2-largeModel Type=ASR model2026.01 | 7.57 | — | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 7.7 | — | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 7.7 | — | |
| GER (Cascaded)Framework=Qwen2.5-Omni, External Reference=Canary-1b-v22026.01 | 7.72 | — | |
| Gemini-2-FlashModel Type=Omni-LLM2026.01 | 7.89 | — | |
| Maestro2022.12 | 8.1 | — | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 8.37 | — | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 8.37 | — | |
| GLM-ASR-nanoModel Size=1.5B (↓)2026.04 | 8.52 | — | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | 8.52 | — | |
| mSLAM-CTCnumber of parameters=2B2022.12 | 9.1 | — | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 9.24 | — | |
| dLLM-ASRDecoder Params=8.02B2026.01 | 9.56 | 0.06 | |
| Whisper-LLaDADecoder Params=8.02B2026.01 | 9.68 | 1.344 | |
| Whisper-LLaMA3Decoder Params=8.03B2026.01 | 9.89 | 0.268 | |
| Whisper-Qwen3Decoder Params=8.19B2026.01 | 10.06 | 0.364 | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 10.26 | — | |
| XLS-Rnumber of parameters=1B2022.12 | 10.6 | — | |
| GPT-4o-voiceModel Type=Omni-LLM2026.01 | 10.83 | — | |
| Whispermode=zero-shot2022.12 | 13.6 | — | |
| VP-10Kmode=fine-tuned2022.12 | 15.3 | — |