Automatic Speech Recognition on AISHELL-2 (CER)
2.27CERSeed-ASR
Evaluation Results
| Method | Links | |
|---|---|---|
| Seed-ASR2026.03 | 2.27 | |
| FireRedASR-AED2026.03 | 2.52 | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 2.57 | |
| Uni-ASRStreaming mode=false, Beam search decoding width=32026.03 | 2.6 | |
| Qwen3-ASR-1.7B2026.03 | 2.71 | |
| Fun-ASR-nano2026.03 | 2.75 | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 3.08 | |
| Uni-ASRStreaming mode=true, Chunk length=1000 ms, Beam search decoding width=32026.03 | 3.25 | |
| Uni-ASRChunk length=10002026.03 | 3.25 | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 3.48 | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 3.99 | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 4.42 | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 4.52 | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 4.62 | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 4.69 | |
| MoCha-ASR2026.03 | 5.5 | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 5.56 | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 5.67 | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 5.94 | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 5.95 | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.88 | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 7.02 | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.65 | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 9.21 | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 9.67 | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 10.01 | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 13.85 | |
| VisPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 14.57 | |
| VisionZipBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 20.55 |