Speech-to-Text Question Answering on TriviaQA (Accuracy)
71.8AccuracySPEECH-OMNI-LITE
Evaluation Results
| Method | Links | |
|---|---|---|
| SPEECH-OMNI-LITEModel Parameters=32B, Projector-only training=true2026.03 | 71.8 | |
| ChatGPT-4o2026.03 | 69.7 | |
| VocalNetModel Parameters=8B2026.03 | 62.16 | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 57.2 | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 56.8 | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 54.7 | |
| Freeze-OmniModel Parameters=7B2026.03 | 51.15 | |
| GLM-4-VoiceModel Parameters=9B2026.03 | 49.5 | |
| LLaMA-Omni2Model Parameters=7B2026.03 | 48.7 | |
| ELLSAmode=S2T2025.10 | 45.2 | |
| Freeze-Omnimode=S2T2025.10 | 45.1 | |
| SPEECH-OMNI-LITEModel Parameters=4B, Projector-only training=true2026.03 | 41.3 | |
| Qwen2-AudioType=AR, S→S capability=false2026.01 | 38.5 | |
| DiFFAType=Diff., S→S capability=false2026.01 | 36 | |
| OSUM-EChat2026.03 | 33.7 | |
| DIFFUSPEECHType=Diff., S→S capability=true2026.01 | 33.5 | |
| MoshiType=AR, S→S capability=true2026.01 | 30.5 | |
| OSUM-Pangu2026.03 | 28.9 | |
| DeepTalk2026.03 | 27.5 | |
| GLM-4-Voice2026.03 | 26.5 | |
| Moshimode=S2T2025.10 | 25.6 | |
| MinMoType=AR, S→S capability=true2026.01 | 25.5 | |
| Llama-Omni2Type=AR, S→S capability=true2026.01 | 23.9 | |
| Phi-4-MultimodalType=AR, S→S capability=false2026.01 | 22.8 | |
| SpeechGPTType=AR, S→S capability=true2026.01 | 8.2 | |
| SpiritLMType=AR, S→S capability=true2026.01 | 4.2 |