Factuality Evaluation on TriviaQA
90.6Response AccuracyGPT-4o Audio
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4o Audio2026.04 | 90.6 | — | — | 5.5 | — | — | |
| MoshiRAGRetrieval Backend=GPT 4.1, Base LM Size=7B2026.04 | 78.2 | 86.8 | — | — | — | — | |
| MoshiRAGRetrieval Backend=Tavily, Base LM Size=7B2026.04 | 77.5 | 84.9 | — | — | — | — | |
| Qwen3-Omni-A3B-Ins.Base LM Size=30B2026.04 | 73.6 | — | 3.7 | 2 | 5.7 | 0.57 | |
| MoshiRAGRetrieval Backend=Gemma 3 27B, Base LM Size=7B2026.04 | 69.6 | 73.7 | 0 | 3.1 | 3.1 | 0.37 | |
| SALMONN-omniBase LM Size=8B2026.04 | 66 | — | — | — | — | — | |
| LLaMA-Omni2Base LM Size=14B2026.04 | 63.8 | — | 0.1 | 2.8 | 2.9 | 2.58 | |
| Kimi-AudioBase LM Size=7B2026.04 | 62.1 | — | 0.2 | 3.3 | 3.5 | 6.93 | |
| Baichuan-AudioBase LM Size=7B2026.04 | 61.7 | — | 1 | 3.8 | 4.8 | 0.84 | |
| Step-Audio-ChatBase LM Size=130B2026.04 | 58 | — | 6.2 | 4.3 | 10.4 | 5.03 | |
| Qwen 2.5 OmniBase LM Size=7B2026.04 | 58 | — | 1.1 | 3.2 | 4.3 | 4.57 | |
| Freeze-OmniBase LM Size=7B2026.04 | 53.9 | — | 1.2 | 5.2 | 6.5 | 0.18 | |
| STITCH-SBase LM Size=9B2026.04 | 50 | — | — | — | — | — | |
| MinMoBase LM Size=7B2026.04 | 48.3 | — | — | — | — | — | |
| GLM-4-VoiceBase LM Size=9B2026.04 | 39.1 | — | 0.3 | 4.2 | 4.4 | 0.74 | |
| Vanilla MoshiBase LM Size=7B, Training=fine-tuned on RAG data2026.04 | 29.7 | — | 0 | 3.1 | 3.1 | 0.22 | |
| LUCYBase LM Size=7B2026.04 | 27 | — | — | — | — | — | |
| Vanilla MoshiBase LM Size=7B2026.04 | 22.8 | — | 0 | 2.1 | 2.1 | 0.22 |