Automatic Speech Recognition on AISHELL-1 (CER)
0.54CERFireRed-ASR
Evaluation Results
| Method | Links | |
|---|---|---|
| FireRed-ASRParams=1.1B2026.01 | 0.54 | |
| FireRedASR-AED2026.03 | 0.55 | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 0.61 | |
| Step-Audio2Params=null2026.01 | 0.63 | |
| Seed-ASRParams=null2026.01 | 0.68 | |
| Seed-ASR2026.03 | 0.68 | |
| Kimi-AudioParams=null2026.01 | 0.71 | |
| Fun-ASRParams=7.7B2026.01 | 1.22 | |
| Uni-ASRStreaming mode=false, Beam search decoding width=32026.03 | 1.44 | |
| Polyglot-Lion-1.7BParams=1.7B2026.03 | 1.45 | |
| Qwen3-ASR-1.7BModel Scale=1.7B2026.05 | 1.5 | |
| Qwen3-ASR-1.7BParams=1.7B2026.03 | 1.52 | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 1.52 | |
| Seed-ASR*Params=null2026.01 | 1.63 | |
| Fun-ASR-nanoParams=0.8B2026.01 | 1.8 | |
| Fun-ASR-nano2026.03 | 1.8 | |
| GLM-ASR-nanoParams=1.5B2026.01 | 1.81 | |
| GLM-ASR-nano2026.03 | 1.81 | |
| GPA-3BParams=3.0B2026.01 | 1.93 | |
| Polyglot-Lion-0.6BParams=0.6B2026.03 | 1.93 | |
| Ark-Base+TD+OPDModel Scale=0.6B, TD=Teacher-data adaptation, OPD=On-policy distillation2026.05 | 1.95 | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 2.05 | |
| Qwen3-ASR-0.6BModel Scale=0.6B2026.05 | 2.07 | |
| Qwen3-ASR-0.6BParams=0.6B2026.03 | 2.08 | |
| Uni-ASRStreaming mode=true, Chunk length=1000 ms, Beam search decoding width=32026.03 | 2.15 | |
| Uni-ASRChunk length=10002026.03 | 2.15 | |
| GLM-ASR-nano*Params=1.5B2026.01 | 2.17 | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 2.22 | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 2.47 | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 2.69 | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 2.7 | |
| Ark-Base+OPDModel Scale=0.6B, OPD=On-policy distillation2026.05 | 3 | |
| MERaLiON-2-10B-ASRParams=10B2026.03 | 3.09 | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 3.28 | |
| Ark-BaseModel Scale=0.6B, Checkpoints=100k-hour supervised2026.05 | 3.48 | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 3.53 | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 3.58 | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 4.18 | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 4.36 | |
| GPA-0.3BParams=0.3B2026.01 | 4.5 | |
| Whisper-LParams=1.55B2026.01 | 4.72 | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 4.88 | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 5.07 | |
| MoCha-ASR2026.03 | 5.1 | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 5.4 | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 6.42 | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.84 | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.91 | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.99 | |
| Qwen2.5-Omni-7BParams=7B2026.03 | 7.33 | |
| Whisper-large-v3-turboParams=0.8B2026.03 | 9.64 | |
| SeaLLMs-Audio-7BParams=7B2026.03 | 9.65 | |
| VisPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 11.68 | |
| VisionZipBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 13.9 | |
| Qwen2.5-Omni-3BParams=3B2026.03 | 28.25 |