Speech-to-Text Question-Answering on LlamaQ
86AccuracySPEECH-OMNI-LITE
Evaluation Results
| Method | Links | |
|---|---|---|
| SPEECH-OMNI-LITEModel Parameters=32B, Projector-only training=true2026.03 | 86 | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 85 | |
| VocalNetModel Parameters=8B2026.03 | 83.33 | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 79.67 | |
| LLaMA-Omni2Model Parameters=7B2026.03 | 79.33 | |
| Freeze-OmniModel Parameters=7B2026.03 | 78.67 | |
| SPEECH-OMNI-LITEModel Parameters=4B, Projector-only training=true2026.03 | 78.33 | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 77.67 | |
| GLM-4-VoiceModel Parameters=9B2026.03 | 76.67 | |
| ELLSAmode=S2T2025.10 | 74.7 | |
| Freeze-Omnimode=S2T2025.10 | 74.2 | |
| ChatGPT-4o2026.03 | 71.7 | |
| DIFFUSPEECHType=Diff., S→S capability=true2026.01 | 68.5 | |
| MoshiType=AR, S→S capability=true2026.01 | 64.2 | |
| MinMoType=AR, S→S capability=true2026.01 | 63.8 | |
| Moshimode=S2T2025.10 | 60.8 | |
| Llama-Omni2Type=AR, S→S capability=true2026.01 | 60.7 | |
| Phi-4-MultimodalType=AR, S→S capability=false2026.01 | 60.2 | |
| DeepTalk2026.03 | 59.7 | |
| DiFFAType=Diff., S→S capability=false2026.01 | 58.3 | |
| Qwen2-AudioType=AR, S→S capability=false2026.01 | 55.4 | |
| OSUM-EChat2026.03 | 55.3 | |
| GLM-4-Voice2026.03 | 50.7 | |
| OSUM-Pangu2026.03 | 44.6 | |
| SpiritLMType=AR, S→S capability=true2026.01 | 38.7 | |
| SpeechGPTType=AR, S→S capability=true2026.01 | 5.4 |