Automatic Speech Recognition on FLEURS en
2.72WERQwen3-Omni-A3B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Omni-A3B-InstructVariant=Omni-A3B-Instruct2026.03 | 2.72 | |
| Step-Audio-2-miniVersion=2-mini2026.03 | 3.05 | |
| Qwen3-ASR-1.7B2026.05 | 3.23 | |
| Qwen3-ASR-1.7B2026.03 | 3.35 | |
| Seed-ASR2026.03 | 3.43 | |
| MiniCPM-o 4.52026.04 | 3.52 | |
| StepAudio 2.5 ASRMTP training=true2026.05 | 3.55 | |
| Raon-Speech2026.04 | 3.59 | |
| StepAudio 2.5 ASRMTP training=false2026.05 | 3.74 | |
| Qwen2.5-Omni2026.04 | 4.05 | |
| GLM-ASR-NanoBase Model=GLM-ASR-Nano2026.02 | 4.11 | |
| Whisper-large-v22026.03 | 4.2 | |
| Uni-ASRStreaming mode=false, Beam search decoding width=32026.03 | 4.44 | |
| Kimi-Audio2026.03 | 4.44 | |
| Kimi Audio2026.04 | 4.54 | |
| Step-Audio Flamingo 32026.04 | 4.54 | |
| SampBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 4.83 | |
| Fun-Audio Omni2026.04 | 4.89 | |
| Kimi-AudioBase Model=Kimi-Audio2026.02 | 4.92 | |
| FunASR-Nano2026.05 | 4.96 | |
| Qwen2-AudioBase Model=Qwen2-Audio2026.02 | 5.2 | |
| VibeVoice-ASR2026.05 | 5.2 | |
| LongCat-Next2026.03 | 5.24 | |
| HyperCLOVA X 8B Omni2026.04 | 5.57 | |
| A-ToMeBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 5.77 | |
| CDPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 5.93 | |
| SampBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 5.94 | |
| Fun-ASR-nano2026.03 | 5.96 | |
| Gemini-3.1-Flash-Lite-previewVersion=3.1, Tier=Flash-Lite-preview2026.03 | 5.96 | |
| Uni-ASRStreaming mode=true, Chunk length=1000 ms, Beam search decoding width=32026.03 | 6.24 | |
| SampBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.26 | |
| MiMo-Audio2026.03 | 6.33 | |
| FastAdaSPBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 6.7 | |
| Doubao-ASR-26032026.05 | 6.74 | |
| Gemini-2.5-Flash-Lite-previewVersion=2.5, Tier=Flash-Lite-preview2026.03 | 6.84 | |
| VisionZipBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 6.85 | |
| CDPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.17 | |
| FastAdaSPBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.31 | |
| A-ToMeBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.57 | |
| Fun-Audio Chat2026.04 | 7.61 | |
| FastAdaSPBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.64 | |
| VisPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 7.82 | |
| VisionZipBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 8.08 | |
| A-ToMeBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 8.13 | |
| VisPrunerBase Model=GLM-ASR-Nano, Token Retention Rate=70%, Compression Ratio=30%2026.02 | 8.33 | |
| VisPrunerBase Model=Qwen2-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 8.39 | |
| CDPrunerBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 8.66 | |
| VisionZipBase Model=Kimi-Audio, Token Retention Rate=60%, Compression Ratio=40%2026.02 | 8.91 | |
| Interactive 2 mini2026.04 | 13.02 |