Automatic Speech Recognition on VoxPopuli (dev)
6.02WERASR + DLM
Evaluation Results
| Method | Links | |
|---|---|---|
| ASR + DLMSystem=ASR + DLM2025.12 | 6.02 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 6.18 | |
| OursModel Size=2.3B2026.04 | 6.25 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 6.26 | |
| ASR + LMSystem=ASR + LM2025.12 | 6.3 | |
| ASR onlySystem=ASR only2025.12 | 6.61 | |
| Qwen3-Omni-InstModel Size=30B-A3B (↑)2026.04 | 6.86 | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 6.86 | |
| Qwen3-ASR-1.7BModel Size=2.0B (↓)2026.04 | 7.58 | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 7.58 | |
| Fun-ASR-nanoModel Size=0.8B (↓)2026.04 | 7.86 | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 7.86 | |
| GLM-ASR-nanoModel Size=1.5B (↓)2026.04 | 8.78 | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | 8.78 | |
| Step-Audio2-miniModel Size=8B+ (↑)2026.04 | 8.86 | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 8.86 | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 9.38 | |
| FireRedASR-LLMModel Size=8B+ (↑)2026.04 | 10.65 |