Audio Understanding on MMAU (Speech, Sound, Music, Overall)
80.4Overall ScoreQwen3.5-Omni
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3.5-OmniOpen-Source=false, Size=Flash, Reasoning mode=Reasoning off2026.04 | 80.4 | — | — | — | — | |
| Qwen3-OmniOpen-Source=true, Size=30B-A3B, Reasoning mode=Reasoning off2026.04 | 77.5 | — | — | — | — | |
| Nemotron 3 Nano OmniOpen-Source=true, Size=30B-A3B, Reasoning mode=Reasoning off2026.04 | 76.9 | 72.8 | — | 74.2 | — | |
| Step-Audio2Audio Input Architecture=Continuous2026.04 | 72.7 | 68.2 | 79.3 | 68.4 | — | |
| Qwen2.5-OmniAudio Input Architecture=Continuous2026.04 | 71.5 | 70.6 | 78.1 | 65.9 | — | |
| UAS-AudioAudio Input Architecture=Continuous2026.04 | 69.4 | 67 | 70 | 71.3 | — | |
| Kimi-AudioAudio Input Architecture=Continuous2026.04 | 68.2 | 62.2 | 75.7 | 66.8 | — | |
| UniAudio-TokenBackbone=Qwen2.5-3B, Tuning strategy=tuned identically2026.05 | 61.1 | 45.05 | 70.27 | 67.96 | — | |
| UAS-Audio-DAudio Input Architecture=Discrete2026.04 | 56 | 46.25 | 59.16 | 62.57 | — | |
| GLM-4-Voice-TokenizerBackbone=Qwen2.5-3B, Tuning strategy=tuned identically2026.05 | 55.2 | 43.24 | 60.06 | 62.28 | — | |
| CosyVoice2Backbone=Qwen2.5-3B, Tuning strategy=tuned identically2026.05 | 54.7 | 39.94 | 61.56 | 62.57 | — | |
| StableTokenBackbone=Qwen2.5-3B, Tuning strategy=tuned identically2026.05 | 53.2 | 45.05 | 58.56 | 55.99 | — | |
| WavTokenizerBackbone=Qwen2.5-3B, Tuning strategy=tuned identically2026.05 | 51.7 | 36.94 | 60.36 | 57.78 | — | |
| GLM-4-VoiceAudio Input Architecture=Discrete2026.04 | 30.3 | 35.44 | 27.63 | 27.84 | — |