Factuality Evaluation on LlamaQ
88.4Response AccuracyGPT-4o Audio
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4o Audio2026.04 | 88.4 | — | — | 5.5 | — | — | |
| Qwen3-Omni-A3B-Ins.Base LM Size=30B2026.04 | 84.7 | — | 3.7 | 2 | 5.7 | 0.57 | |
| Step-Audio-ChatBase LM Size=130B2026.04 | 81 | — | 6.2 | 4.3 | 10.4 | 5.03 | |
| MoshiRAGRetrieval Backend=GPT 4.1, Base LM Size=7B2026.04 | 80.6 | 87.8 | — | — | — | — | |
| MoshiRAGRetrieval Backend=Gemma 3 27B, Base LM Size=7B2026.04 | 80.3 | 83 | 0 | 3.1 | 3.1 | 0.37 | |
| SALMONN-omniBase LM Size=8B2026.04 | 80 | — | — | — | — | — | |
| Kimi-AudioBase LM Size=7B2026.04 | 79.3 | — | 0.2 | 3.3 | 3.5 | 6.93 | |
| Qwen 2.5 OmniBase LM Size=7B2026.04 | 79 | — | 1.1 | 3.2 | 4.3 | 4.57 | |
| MinMoBase LM Size=7B2026.04 | 78.9 | — | — | — | — | — | |
| Baichuan-AudioBase LM Size=7B2026.04 | 78.4 | — | 1 | 3.8 | 4.8 | 0.84 | |
| MoshiRAGRetrieval Backend=Tavily, Base LM Size=7B2026.04 | 78.2 | 84.6 | — | — | — | — | |
| STITCH-SBase LM Size=9B2026.04 | 73.3 | — | — | — | — | — | |
| LLaMA-Omni2Base LM Size=14B2026.04 | 73 | — | 0.1 | 2.8 | 2.9 | 2.58 | |
| Freeze-OmniBase LM Size=7B2026.04 | 72 | — | 1.2 | 5.2 | 6.5 | 0.18 | |
| GLM-4-VoiceBase LM Size=9B2026.04 | 64.7 | — | 0.3 | 4.2 | 4.4 | 0.74 | |
| Vanilla MoshiBase LM Size=7B2026.04 | 62.3 | — | 0 | 2.1 | 2.1 | 0.22 | |
| Vanilla MoshiBase LM Size=7B, Training=fine-tuned on RAG data2026.04 | 61.2 | — | 0 | 3.1 | 3.1 | 0.22 | |
| LUCYBase LM Size=7B2026.04 | 59.7 | — | — | — | — | — |