Speech-to-Text Question-Answering on WebQ
66.6AccuracySPEECH-OMNI-LITE
Evaluation Results
| Method | Links | |
|---|---|---|
| SPEECH-OMNI-LITEModel Parameters=32B, Projector-only training=true2026.03 | 66.6 | |
| VocalNetModel Parameters=8B2026.03 | 62.9 | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 61.6 | |
| Freeze-OmniModel Parameters=7B2026.03 | 54.1 | |
| ChatGPT-4o2026.03 | 51.6 | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 51.5 | |
| LLaMA-Omni2Model Parameters=7B2026.03 | 51.4 | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 49.9 | |
| DIFFUSPEECHType=Diff., S→S capability=true2026.01 | 49.7 | |
| GLM-4-VoiceModel Parameters=9B2026.03 | 49.5 | |
| SPEECH-OMNI-LITEModel Parameters=4B, Projector-only training=true2026.03 | 43.7 | |
| DiFFAType=Diff., S→S capability=false2026.01 | 43.4 | |
| Qwen2-AudioType=AR, S→S capability=false2026.01 | 41.2 | |
| Freeze-Omnimode=S2T2025.10 | 40.8 | |
| MoshiType=AR, S→S capability=true2026.01 | 40.7 | |
| MinMoType=AR, S→S capability=true2026.01 | 39.9 | |
| ELLSAmode=S2T2025.10 | 39.5 | |
| Llama-Omni2Type=AR, S→S capability=true2026.01 | 37.1 | |
| OSUM-EChat2026.03 | 30.4 | |
| OSUM-Pangu2026.03 | 29.5 | |
| Phi-4-MultimodalType=AR, S→S capability=false2026.01 | 26.6 | |
| Moshimode=S2T2025.10 | 23.4 | |
| DeepTalk2026.03 | 23.1 | |
| GLM-4-Voice2026.03 | 15.9 | |
| SpiritLMType=AR, S→S capability=true2026.01 | 9.6 | |
| SpeechGPTType=AR, S→S capability=true2026.01 | 5.5 |