Audio Question Answering on MMAU
77.5ScoreQwen3-Omni (Sep 25)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Omni (Sep 25)Model Category=Omnimodal MLLMs2026.04 | 77.5 | |
| Gemini 2.5 Pro (May 25)Model Category=Closed-Source APIs2026.04 | 77.4 | |
| Omni-o3Model Category=Omnimodal MLLMs2026.04 | 75.6 | |
| AFlamingo3 (NeurIPS 25)Model Category=Audio MLLMs2026.04 | 72.4 | |
| Gemini 2.5 ProModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 70 | |
| Audio-Captioner-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 70 | |
| Gemini 2.5 ProModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 70 | |
| Audio-Captioner-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 70 | |
| Ola (Feb 25)Model Category=Omnimodal MLLMs2026.04 | 67.1 | |
| Gemini 2.5 FlashModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 65.6 | |
| Gemini 2.5 FlashModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 65.6 | |
| Qwen2.5-Omni (Mar 25)Model Category=Omnimodal MLLMs2026.04 | 65.5 | |
| Qwen2.5-Omni-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 65.2 | |
| Qwen2.5-Omni-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 65.2 | |
| DeSTA 2.5 (Jul 25)Model Category=Audio MLLMs2026.04 | 65.2 | |
| AudioReaonser (Sep 25)Model Category=Audio MLLMs2026.04 | 63.8 | |
| Qwen2-Audio-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 63.3 | |
| Qwen2-Audio-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 63.3 | |
| GPT-4o (May 24)Model Category=Closed-Source APIs2026.04 | 62.5 | |
| GPT-4o AudioModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 62.4 | |
| GPT-4o AudioModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 62.4 | |
| MiDashengLM-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 59.4 | |
| MiDashengLM-7BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 59.4 | |
| Gemini 2.0 FlashModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 58.6 | |
| Gemini 2.0 FlashModel Category=Proprietary Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 58.6 | |
| SALMONN-13BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 58.36 | |
| SALMONN-13BModel Category=Open-Source Models, QA Backbone=GPT-4o, Evaluation Protocol=caption-to-QA cascade2025.10 | 58.36 | |
| Qwen2-Audio (Jul 24)Model Category=Audio MLLMs2026.04 | 57.4 |