Automatic Speech Recognition on LibriSpeech (WER)
1.1WERQwen3.5-Omni-Realtime-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-Omni-Realtime-FlashEvaluation Mode=real-time mode, Latency (s)=1.252026.06 | 1.1 | |
| Kimi-Audio-7B-Instructcategory=foundation-model calibration2026.06 | 1.28 | |
| Qwen3-Omni-Realtime-FlashEvaluation Mode=real-time mode, Latency (s)=1.282026.06 | 1.3 | |
| Audio Flamingo 3category=foundation-model calibration2026.06 | 1.57 | |
| Qwen2-Audio-Instructcategory=foundation-model calibration2026.06 | 1.6 | |
| Qwen2.5-Omni-7Bcategory=foundation-model calibration2026.06 | 1.8 | |
| Qwen-Audio-Chatcategory=foundation-model calibration2026.06 | 2 | |
| WavLLMcategory=academic, open, or public-data speech/audio LLMs2026.06 | 2 | |
| SALMONNcategory=academic, open, or public-data speech/audio LLMs2026.06 | 2.1 | |
| AlignFormercategory=academic, open, or public-data speech/audio LLMs2026.06 | 3.52 | |
| Gemini-3.1-Flash-LiteEvaluation Mode=real-time mode2026.06 | 3.8 | |
| C-Gate-3Tcategory=academic, open, or public-data speech/audio LLMs2026.06 | 3.98 | |
| Gemini-3.1-Flash-LiveEvaluation Mode=real-time mode, Latency (s)=2.572026.06 | 4.1 | |
| LTU-AScategory=academic, open, or public-data speech/audio LLMs2026.06 | 4.9 | |
| BLSP+RPcategory=academic, open, or public-data speech/audio LLMs2026.06 | 6.4 | |
| wav2vec 2.02026.06 | 9.7 | |
| ViP-VL2026.06 | 9.7 | |
| 8× BEST-RQ2026.06 | 11.9 | |
| DuplexOmniEvaluation Mode=real-time mode, Latency (s)=0.5062026.06 | 11.92 |