Automatic Speech Recognition on WenetSpeech Net (test)
4.6CERFireRedASR-LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FireRedASR-LLM#Params=8.3B2025.01 | 4.6 | — | |
| Seed-ASR#Params=12B+2025.01 | 4.66 | — | |
| Seed-ASR2026.03 | 4.66 | — | |
| FireRedASR-AED#Params=1.1B2025.01 | 4.88 | — | |
| FireRedASR-AED2026.03 | 4.88 | — | |
| Qwen3-ASR-1.7B2026.03 | 4.97 | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 5.39 | — | |
| Uni-ASRStreaming mode=false, Beam search decoding width=32026.03 | 5.78 | — | |
| SenseVoice-L#Params=1.6B2025.01 | 6.01 | — | |
| Fun-ASR-nano2026.03 | 6.01 | — | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 6.2 | — | |
| Uni-ASRStreaming mode=true, Chunk length=1000 ms, Beam search decoding width=32026.03 | 6.44 | — | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 6.65 | — | |
| Paraformer-Large#Params=0.2B2025.01 | 6.74 | — | |
| Baichuan-omniParameters=7B2024.10 | 7.1 | 6.9 | |
| Zipformer-LParams (M)=160.9, Type=pruned transducer2023.10 | 7.24 | — | |
| Zipformer-MParams (M)=75.9, Type=pruned transducer2023.10 | 7.61 | — | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 7.64 | — | |
| Conformer-MoENumber of Experts=32e2022.04 | 7.99 | — | |
| Conformer-MoE(32e)Type=CTC/AED, MoE2023.10 | 7.99 | — | |
| Conformer-MoENumber of Experts=16e2022.04 | 8.28 | — | |
| Conformer-MoE(16e)Params (M)=425, Type=CTC/AED, MoE2023.10 | 8.28 | — | |
| Conformer-MoENumber of Experts=64e2022.04 | 8.36 | — | |
| Conformer-MoE(64e)Type=CTC/AED, MoE2023.10 | 8.36 | — | |
| Zipformer-SParams (M)=32.3, Type=pruned transducer2023.10 | 8.6 | — | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 8.7 | — | |
| Espnet2022.04 | 8.9 | — | |
| Conformer in ESPnetParams (M)=116.9, Type=CTC/AED2023.10 | 8.9 | — | |
| Qwen-Audio#Params=8.4B2025.01 | 9.5 | — | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 9.6 | — | |
| Wenet2022.04 | 9.7 | — | |
| Conformer in WeNetParams (M)=116.9, Type=CTC/AED2023.10 | 9.7 | — | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 10.11 | — | |
| Whisper-Large-v3#Params=1.6B2025.01 | 10.48 | — | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 10.9 | — | |
| Qwen2-Audio-InstructParameters=7B2024.10 | 11.3 | 11 | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 11.7 | — | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 12.08 | — | |
| VITAParameters=8x7B2024.10 | 12.2 | — | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 12.3 | — | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 12.35 | — | |
| Kaldi2022.04 | 12.83 | — | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.07 | — | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 14.1 | — | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.15 | — | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.75 | — | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.99 | — | |
| SPEECH-OMNI-LITEModel Parameters=32B, Projector-only training=true2026.03 | 16.5 | — | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 16.54 | — | |
| VisPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 16.56 | — | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 18.41 | — | |
| Whisper-large-v3Parameters=1.55B2024.10 | 18.5 | 17.5 | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 18.56 | — | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 19.51 | — | |
| SPEECH-OMNI-LITEModel Parameters=4B, Projector-only training=true2026.03 | 19.92 | — | |
| VisionZipBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 20.45 | — | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 23.75 | — | |
| Gemini-2.5-Flash-Lite-previewVersion=2.5, Tier=Flash-Lite-preview2026.03 | — | 24.83 | |
| Gemini-3.1-Flash-Lite-previewVersion=3.1, Tier=Flash-Lite-preview2026.03 | — | 16.15 | |
| Kimi-Audio2026.03 | — | 5.37 | |
| LongCat-Next2026.03 | — | 5.98 | |
| MiMo-Audio2026.03 | — | 7.64 | |
| Qwen3-Omni-A3B-InstructVariant=Omni-A3B-Instruct2026.03 | — | 4.69 | |
| Step-Audio-2-miniVersion=2-mini2026.03 | — | 4.82 |