Factuality Evaluation on WebQ
81Accuracy (Response)GPT-4o Audio
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4o Audio2026.04 | 81 | — | — | 5.5 | — | — | |
| Step-Audio-ChatBase LM Size=130B2026.04 | 75.1 | — | 6.2 | 4.3 | 10.4 | 5.03 | |
| Kimi-AudioBase LM Size=7B2026.04 | 70.2 | — | 0.2 | 3.3 | 3.5 | 6.93 | |
| MoshiRAGRetrieval Backend=GPT 4.1, Base LM Size=7B2026.04 | 68.9 | 77.7 | — | — | — | — | |
| Qwen3-Omni-A3B-Ins.Base LM Size=30B2026.04 | 68.8 | — | 3.7 | 2 | 5.7 | 0.57 | |
| MoshiRAGRetrieval Backend=Gemma 3 27B, Base LM Size=7B2026.04 | 67.2 | 71.5 | 0 | 3.1 | 3.1 | 0.37 | |
| MoshiRAGRetrieval Backend=Tavily, Base LM Size=7B2026.04 | 66.1 | 73.5 | — | — | — | — | |
| Baichuan-AudioBase LM Size=7B2026.04 | 64.5 | — | 1 | 3.8 | 4.8 | 0.84 | |
| Qwen 2.5 OmniBase LM Size=7B2026.04 | 62 | — | 1.1 | 3.2 | 4.3 | 4.57 | |
| MinMoBase LM Size=7B2026.04 | 55 | — | — | — | — | — | |
| SALMONN-omniBase LM Size=8B2026.04 | 50.5 | — | — | — | — | — | |
| STITCH-SBase LM Size=9B2026.04 | 50.2 | — | — | — | — | — | |
| Freeze-OmniBase LM Size=7B2026.04 | 44.7 | — | 1.2 | 5.2 | 6.5 | 0.18 | |
| LLaMA-Omni2Base LM Size=14B2026.04 | 40.4 | — | 0.1 | 2.8 | 2.9 | 2.58 | |
| Vanilla MoshiBase LM Size=7B, Training=fine-tuned on RAG data2026.04 | 37 | — | 0 | 3.1 | 3.1 | 0.22 | |
| GLM-4-VoiceBase LM Size=9B2026.04 | 32.2 | — | 0.3 | 4.2 | 4.4 | 0.74 | |
| LUCYBase LM Size=7B2026.04 | 29.3 | — | — | — | — | — | |
| Vanilla MoshiBase LM Size=7B2026.04 | 26.6 | — | 0 | 2.1 | 2.1 | 0.22 |