Massive Multi-discipline Audio Understanding on MMAU
69.23Speech ScoreLGT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LGTBackbone=Qwen2.5-Omni-7B, Stage=SFT + DPO2025.11 | 69.23 | — | 77.75 | 70.35 | |
| Qwen2.5-Omni-7BModel Role=Baseline Omni Model2025.11 | 68.9 | — | 76.77 | 67.33 | |
| LGTBackbone=Qwen2.5-Omni-7B, Stage=SFT Only2025.11 | 68.8 | — | 78.3 | 70.2 | |
| MiMo-AudioModel Scale=7B-Base2025.12 | 67.6 | 66 | 65.2 | 65.3 | |
| LPTBackbone=Qwen2.5-Omni-7B2025.11 | 66.93 | — | 76.63 | 67.56 | |
| VirgoBackbone=Qwen2.5-Omni-7B2025.11 | 64.3 | — | 64.2 | 59.3 | |
| DeSTA2.5-Audio2025.07 | 59.16 | 57.5 | 60.66 | 52.69 | |
| ASR+LLM2025.07 | 57.96 | 47.6 | 38.44 | 46.41 | |
| ASR+AAC+LLM2025.07 | 57.96 | 51.1 | 48.35 | 47.01 | |
| DeSTA22025.07 | 55.86 | 50.4 | 47.75 | 47.6 | |
| Step-Audio2-miniModel Scale=7B-Base2025.12 | 55 | 60.3 | 67.9 | 58.1 | |
| Qwen2-Audio-Instruct2025.07 | 42.04 | 49.2 | 54.95 | 50.98 | |
| SALMONN2025.07 | 34.8 | 33.7 | 41 | 25.5 | |
| Qwen-Audio2025.07 | 30.03 | 43.1 | 44 | 55.25 | |
| Kimi-AudioModel Scale=7B-Base2025.12 | 29.4 | 28.6 | 31.5 | 24.8 | |
| LTU-AS2025.07 | 23.35 | 17.68 | 9.1 | 20.6 | |
| Baichuan-AudioModel Scale=7B-Base2025.12 | 14.4 | 25.9 | 30.3 | 32.9 |