Logical Reasoning on URO-Bench
95.53GSM8k ScoreKIMI-AUDIO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| KIMI-AUDIOModel Size=7B2026.07 | 95.53 | 57.61 | 93.59 | 87.91 | |
| ASR + TEXT LLMSpeech-to-Text=whisper-large-v3, LLM=QWEN3-8B-instruct2026.07 | 94.61 | 71.12 | 93.26 | 94.13 | |
| SPEECHCOMBINEtheta_base=QWEN3-8B-base, theta_inst=QWEN3-8B-instruct, lambda=0.852026.07 | 90.03 | 60.09 | 93.97 | 89.01 | |
| FUN-AUDIO-CHATModel Size=8B2026.07 | 88.31 | 61.27 | 93.97 | 93.4 | |
| CONT. PRE-TRAIN + SFTBase Model=QWEN3-8B-base, Pre-training Data=30k hours, SFT Data=10k hours2026.07 | 87.34 | 42.58 | 83.23 | 88.27 | |
| CONT. PRE-TRAINBase Model=QWEN3-8B-instruct, Speech Data=30k hours2026.07 | 87.05 | 42.11 | 85.31 | 88.27 | |
| GPT-4O-AUDIOModel Size=Significantly larger2026.07 | 80 | 82.67 | 80 | 46.67 | |
| STEP-AUDIO2-MINIModel Size=7B2026.07 | 42.89 | 53.87 | 87.38 | 80.21 | |
| STEP-AUDIO2-MINI-THINKModel Size=7B2026.07 | 39.46 | 52.89 | 85.12 | 76.55 | |
| QWEN-2.5-OMNI2026.07 | 38.09 | 46.25 | 73.33 | 64.83 | |
| AUDIO-FLAMINGO2026.07 | 37.11 | 32.02 | 68.36 | 61.9 | |
| OSUM-ECHATModel Size=3B2026.07 | 32.41 | 36.82 | 46.7 | 51.28 | |
| GLM-4-VOICEModel Size=9B2026.07 | 30.93 | 59.28 | 57.82 | 65.2 |