Automatic Speech Recognition on WenetSpeech (meeting)
4.63WERFireRedASR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FireRedASR2025.12 | 4.63 | — | |
| OSUM2026.03 | 5.34 | 5.34 | |
| Step-Audio 2 mini2025.12 | 5.47 | — | |
| Qwen3-Omni-Instruct2026.02 | 5.89 | — | |
| Index-ASR2025.12 | 6.17 | — | |
| Kimi-Audio2025.12 | 6.27 | — | |
| Kimi Audio2026.02 | 6.28 | — | |
| Kimi-AudioSize=7B2025.09 | 6.34 | — | |
| LongCat-Flash-Omni2026.02 | 6.69 | — | |
| ERNIE 5.02026.02 | 7.36 | — | |
| Qwen2-Audio2026.03 | 8.4 | 8.4 | |
| OSUM-Pangu2026.03 | 10.49 | 10.49 | |
| Gemini-3-Pro2026.02 | 12.08 | — | |
| VITA-AudioSize=7B2025.09 | 20.38 | — | |
| Whisper2025.12 | 20.85 | — | |
| ERNIE 5.0-Base2026.02 | 22.85 | — | |
| Pretrain+TtTSize=3B2025.09 | 27.59 | — | |
| GPT-4o-Audio2026.02 | 32.27 | — | |
| TtTSize=3B2025.09 | 53.83 | — | |
| Qwen2.5-3B (AR)Size=3B2025.09 | 80.01 | — | |
| Qwen2.5-3B (NAR)Size=3B2025.09 | 89.22 | — | |
| SpeechGPTSize=7B2025.09 | 123.15 | — | |
| Mini-OmniSize=0.5B2025.09 | 294.42 | — | |
| Ark-BaseModel Scale=0.6B2026.05 | — | 10.22 | |
| Ark-Base+OPDModel Scale=0.6B, OPD=On-policy distillation2026.05 | — | 7.18 | |
| Ark-Base+TD+OPDModel Scale=0.6B, TD=Teacher-data adaptation, OPD=On-policy distillation2026.05 | — | 5.92 | |
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | — | 3.36 | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | — | 4.68 | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | — | 6.87 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | — | 4.91 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | — | 5.71 | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | — | 4 | |
| Qwen3-ASR-0.6BModel Scale=0.6B2026.05 | — | 5.57 | |
| Qwen3-ASR-1.7BModel Scale=1.7B2026.05 | — | 4.69 | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | — | 3.92 | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | — | 4.23 |