Automatic Speech Recognition on WenetSpeech Meeting (test)
4.67CERFireRedASR-LLM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| FireRedASR-LLM#Params=8.3B2025.01 | 4.67 | — | — | — | |
| FireRedASR-AED#Params=1.1B2025.01 | 4.76 | — | — | — | |
| FireRedASR-AED2026.03 | 4.76 | — | — | — | |
| Step-Audio-2-miniType=Audio, Size=8B2026.02 | 5.43 | — | — | — | |
| Seed-ASR#Params=12B+2025.01 | 5.69 | — | — | — | |
| Seed-ASR2026.03 | 5.69 | — | — | — | |
| Qwen3-ASR-1.7BParameters=1.7B2026.01 | 5.88 | — | — | — | |
| Qwen3-ASR-1.7B2026.03 | 5.88 | — | — | — | |
| Ming-Lite-Omni-1.5Type=Omni, Size=19B-A2.8B2026.02 | 5.96 | — | — | — | |
| Qwen3-Omni-InstructType=Omni, Size=30B-A3B2026.02 | 6.12 | — | — | — | |
| Uni-ASRStreaming mode=false, Beam search decoding width=32026.03 | 6.32 | — | — | — | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 6.33 | — | — | — | |
| Kimi-Audio-7B-InstructType=Audio, Size=7B2026.02 | 6.38 | — | — | — | |
| Fun-ASR-nano2026.03 | 6.6 | — | — | — | |
| SenseVoice-L#Params=1.6B2025.01 | 6.73 | — | — | — | |
| GLM-ASR-nano2026.03 | 6.73 | — | — | — | |
| Qwen3-ASR-0.6BParameters=0.6B2026.01 | 6.88 | — | — | — | |
| Paraformer-large#Parameters=220M, AR/NAR=NAR, LM=w/o, batchsize=12023.05 | 6.97 | 0.0251 | — | — | |
| Paraformer-Large#Params=0.2B2025.01 | 6.97 | — | — | — | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 7.8 | — | — | — | |
| Uni-ASRStreaming mode=true, Chunk length=1000 ms, Beam search decoding width=32026.03 | 8.04 | — | — | — | |
| Qwen2-AudioType=Audio, Size=7B2026.02 | 8.4 | — | — | — | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 8.4 | — | — | — | |
| Qwen2.5-Omni-7BType=Omni, Size=7B2026.02 | 8.43 | — | — | — | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 8.43 | — | — | — | |
| Qwen2.5-Omni-3BType=Omni, Size=3B2026.02 | 8.53 | — | — | — | |
| Baichuan-omniParameters=7B2024.10 | 8.9 | — | 8.4 | — | |
| Eureka-Audio-InstructType=Ours, Size=1.7B2026.02 | 9.14 | — | — | — | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 9.86 | — | — | — | |
| Eureka-Audio-BaseType=Ours, Size=1.7B2026.02 | 10.37 | — | — | — | |
| Qwen2-Audio-InstructParameters=7B2024.10 | 10.8 | — | 10.7 | — | |
| Qwen-Audio#Params=8.4B2025.01 | 10.87 | — | — | — | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 11.05 | — | — | — | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 11.47 | — | — | — | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 11.51 | — | — | — | |
| Zipformer-LParams (M)=160.9, Type=pruned transducer2023.10 | 12.06 | — | — | — | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 12.07 | — | — | — | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 12.29 | — | — | — | |
| Zipformer-MParams (M)=75.9, Type=pruned transducer2023.10 | 12.35 | — | — | — | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 12.62 | — | — | — | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 12.97 | — | — | — | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 13.16 | — | — | — | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 13.37 | — | — | — | |
| Gemini-2.5-Pro2026.01 | 13.47 | — | — | — | |
| Conformer-MoENumber of Experts=32e2022.04 | 13.69 | — | — | — | |
| Conformer-MoE(32e)Type=CTC/AED, MoE2023.10 | 13.69 | — | — | — | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 13.7 | — | — | — | |
| Conformer-MoENumber of Experts=64e2022.04 | 13.72 | — | — | — | |
| Conformer-MoE(64e)Type=CTC/AED, MoE2023.10 | 13.72 | — | — | — | |
| Conformer-MoENumber of Experts=16e2022.04 | 13.96 | — | — | — | |
| Conformer-MoE(16e)Params (M)=425, Type=CTC/AED, MoE2023.10 | 13.96 | — | — | — | |
| Zipformer-SParams (M)=32.3, Type=pruned transducer2023.10 | 13.97 | — | — | — | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.05 | — | — | — | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 14.21 | — | — | — | |
| K2 Transducer#Parameters=110M, AR/NAR=AR, LM=w/o, batchsize=12023.05 | 14.44 | — | — | — | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.65 | — | — | — | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 14.95 | — | — | — | |
| Conformer#Parameters=46.25M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 15.21 | 1.43 | — | — | |
| MiniCPM-oType=Omni, Size=9B2026.02 | 15.53 | — | — | — | |
| Wenet2022.04 | 15.59 | — | — | — | |
| Conformer in WeNetParams (M)=116.9, Type=CTC/AED2023.10 | 15.59 | — | — | — | |
| Espnet2022.04 | 15.9 | — | — | — | |
| ESPnet Conformer#Parameters=110M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 15.9 | — | — | — | |
| Conformer in ESPnetParams (M)=116.9, Type=CTC/AED2023.10 | 15.9 | — | — | — | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 16.1 | — | — | — | |
| VITAParameters=8x7B2024.10 | 16.5 | — | — | — | |
| WeNet Conformer-U2++#Parameters=110M, AR/NAR=AR, LM=w/, batchsize=12023.05 | 17.34 | — | — | — | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 17.88 | — | — | — | |
| VisPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 18.11 | — | — | — | |
| SPEECH-OMNI-LITEModel Parameters=32B, Projector-only training=true2026.03 | 18.18 | — | — | — | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 18.32 | — | — | — | |
| Whisper-Large-v3#Params=1.6B2025.01 | 18.87 | — | — | — | |
| Whisper-large-v32026.01 | 19.11 | — | — | — | |
| VisionZipBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 19.36 | — | — | — | |
| SPEECH-OMNI-LITEModel Parameters=4B, Projector-only training=true2026.03 | 20.74 | — | — | — | |
| Kaldi2022.04 | 24.72 | — | — | — | |
| Whisper-large-v3Parameters=1.55B2024.10 | 31.7 | — | 30.8 | — | |
| GPT-4o-Transcribe2026.01 | 32.27 | — | — | — | |
| Doubao-ASR-26032026.05 | — | — | — | 5.09 | |
| Freeze-Omni#Param=7B2026.05 | — | — | — | 13.46 | |
| FunASR-Nano2026.05 | — | — | — | 5.31 | |
| Gemini-2.5-Flash-Lite-previewVersion=2.5, Tier=Flash-Lite-preview2026.03 | — | — | 23.04 | — | |
| Gemini-3.1-Flash-Lite-previewVersion=3.1, Tier=Flash-Lite-preview2026.03 | — | — | 20.37 | — | |
| Hubert+Baichuan22024.07 | — | — | 6.26 | — | |
| Kimi Audio2025.10 | — | — | 6.28 | — | |
| Kimi-Audio2026.03 | — | — | 6.28 | — | |
| Kimi-AudioSize=9B2026.04 | — | — | 5.4 | — | |
| LongCat-Next2026.03 | — | — | 8.19 | — | |
| MiMo-Audio2026.03 | — | — | 9.49 | — | |
| Ming-Flash-Omni2025.10 | — | — | 5.83 | — | |
| MiniCPM-o 4.5Size=9B2026.04 | — | — | 5.7 | — | |
| NST with LESSIteration=1, LESS=Y2025.06 | — | — | 15 | — | |
| NST with LESSIteration=2, LESS=Y2025.06 | — | — | 14.2 | — | |
| NST with LESSIteration=3, LESS=Y2025.06 | — | — | 13.9 | — | |
| Paraformer-large2024.07 | — | — | 6.97 | — | |
| Qwen-Audio2024.07 | — | — | 10.87 | — | |
| Qwen2 Audio2025.10 | — | — | 7.16 | — | |
| Qwen2.5-Omni#Param=7B2026.05 | — | — | — | 7.71 | |
| Qwen3 Omni2025.10 | — | — | 5.89 | — | |
| Qwen3-ASR-1.7B2026.05 | — | — | — | 4.66 |