Question Answering on VoiceBench
89.23OpenbookQA ScoreGPT-4O-AUDIO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4O-AUDIOModel Size=Significantly larger2026.07 | 89.23 | 80.25 | |
| SPEECHCOMBINEtheta_base=QWEN3-8B-base, theta_inst=QWEN3-8B-instruct, lambda=0.852026.07 | 86.59 | 73.38 | |
| KIMI-AUDIOModel Size=7B2026.07 | 83.52 | 62.17 | |
| FUN-AUDIO-CHATModel Size=8B2026.07 | 83.52 | 71.08 | |
| ASR + TEXT LLMSpeech-to-Text=whisper-large-v3, LLM=QWEN3-8B-instruct2026.07 | 83.29 | 73.22 | |
| QWEN-2.5-OMNI2026.07 | 81.1 | 61.32 | |
| CONT. PRE-TRAIN + SFTBase Model=QWEN3-8B-base, Pre-training Data=30k hours, SFT Data=10k hours2026.07 | 80.21 | 60.8 | |
| CONT. PRE-TRAINBase Model=QWEN3-8B-instruct, Speech Data=30k hours2026.07 | 78.46 | 68.21 | |
| OSUM-ECHATModel Size=3B2026.07 | 78.46 | 60.11 | |
| STEP-AUDIO2-MINIModel Size=7B2026.07 | 72.74 | 54.42 | |
| STEP-AUDIO2-MINI-THINKModel Size=7B2026.07 | 65.7 | 53.87 | |
| AUDIO-FLAMINGO2026.07 | 58.68 | 42.19 | |
| GLM-4-VOICEModel Size=9B2026.07 | 53.41 | 39.75 |