Automatic Speech Recognition on WenetSpeech net (CER)
3.52Character Error Rate (CER)FireRedASR2S LLM
Evaluation Results
| Method | Links | |
|---|---|---|
| FireRedASR2S LLMModel Size=8B+, Inference Mode=Offline2026.04 | 3.52 | |
| Qwen3-Omni InstructModel Size=30B-A3B, Inference Mode=Offline2026.04 | 3.85 | |
| Qwen3-ASR 1.7BModel Size=2.0B, Inference Mode=Offline2026.04 | 4.13 | |
| Qwen3-ASR-1.7BModel Scale=1.7B2026.05 | 4.55 | |
| Step-Audio2 MiniModel Size=8B+, Inference Mode=Offline2026.04 | 4.63 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Offline2026.04 | 4.72 | |
| Qwen3-ASR-1.7BParameters=1.7B2026.01 | 4.97 | |
| NIM4-ASRModel Size=2.3B, Inference Mode=Stream2026.04 | 5 | |
| Fun-ASR NanoModel Size=0.8B, Inference Mode=Offline2026.04 | 5.22 | |
| Ark-Base+TD+OPDModel Scale=0.6B, TD=Teacher-data adaptation, OPD=On-policy distillation2026.05 | 5.39 | |
| Qwen3-ASR-0.6BModel Scale=0.6B2026.05 | 5.45 | |
| GLM-ASR NanoModel Size=1.5B, Inference Mode=Offline2026.04 | 5.72 | |
| Qwen3-ASR-0.6BParameters=0.6B2026.01 | 5.97 | |
| Ark-Base+OPDModel Scale=0.6B, OPD=On-policy distillation2026.05 | 6.13 | |
| FunASR-MLT-Nano2026.01 | 6.35 | |
| Ark-BaseModel Scale=0.6B2026.05 | 7.74 | |
| Whisper-large-v32026.01 | 9.86 | |
| Gemini-2.5-Pro2026.01 | 14.43 | |
| GPT-4o-Transcribe2026.01 | 15.3 |