Audio Question-Answering on MMSU
77.7ScoreGemini 2.5 Pro (May 25)
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 2.5 Pro (May 25)Model Category=Closed-Source APIs2026.04 | 77.7 | |
| Ming-Flash-Omni2025.10 | 72.09 | |
| Omni-o3Model Category=Omnimodal MLLMs2026.04 | 70.4 | |
| Qwen3-Omni (Sep 25)Model Category=Omnimodal MLLMs2026.04 | 69 | |
| Qwen3-Omni-Flash-Instruct2025.10 | 68.4 | |
| Ola (Feb 25)Model Category=Omnimodal MLLMs2026.04 | 62.6 | |
| Kimi-Audio2025.10 | 62.17 | |
| AQA-TTRLBackbone=Qwen2.5-Omni 7B, Protocol=Self-Adaptation2025.10 | 61.48 | |
| AFlamingo3 (NeurIPS 25)Model Category=Audio MLLMs2026.04 | 61.4 | |
| Qwen2.5-Omni2025.10 | 61.32 | |
| Gemini 1.5 Pro (Dec 24)Model Category=Closed-Source APIs2026.04 | 60.7 | |
| Qwen2.5-Omni (Mar 25)Model Category=Omnimodal MLLMs2026.04 | 60.6 | |
| DeSTA 2.5 (Jul 25)Model Category=Audio MLLMs2026.04 | 58.8 | |
| AQA-TTRLBackbone=Qwen2.5-Omni 3B, Protocol=Self-Adaptation2025.10 | 58.18 | |
| DIMVBackbone=Qwen2.5-Omni 7B, Protocol=Direct Inference with Majority Voting2025.10 | 58.16 | |
| SFTBackbone=Qwen2.5-Omni 7B, Protocol=Supervised Fine-Tuning2025.10 | 58.02 | |
| AudioReaonser (Sep 25)Model Category=Audio MLLMs2026.04 | 57.4 | |
| Baichuan-Omni-1.52025.10 | 57.25 | |
| DIBackbone=Qwen2.5-Omni 7B, Protocol=Direct Inference2025.10 | 56.84 | |
| GPT-4o (May 24)Model Category=Closed-Source APIs2026.04 | 56.4 | |
| MiniCPM-o2025.10 | 54.78 | |
| Qwen2-Audio (Jul 24)Model Category=Audio MLLMs2026.04 | 53.3 | |
| Baichuan-Audio2025.10 | 48.8 | |
| SFTBackbone=Qwen2.5-Omni 3B, Protocol=Supervised Fine-Tuning2025.10 | 48.74 | |
| DIMVBackbone=Qwen2.5-Omni 3B, Protocol=Direct Inference with Majority Voting2025.10 | 47.9 | |
| DIBackbone=Qwen2.5-Omni 3B, Protocol=Direct Inference2025.10 | 45.34 | |
| GLM-4-Voice2025.10 | 40.11 | |
| Qwen2-Audio-chat2025.10 | 35.43 | |
| Step-Audio-chat2025.10 | 31.87 | |
| Megrez-3B-Omni2025.10 | 27.03 | |
| DiVA2025.10 | 25.76 |