Speech Question Answering on Llama Questions
64.7Speech QA ScoreGLM-4-Voice
Evaluation Results
| Method | Links | |
|---|---|---|
| GLM-4-Voice2025.08 | 64.7 | |
| TurnGuideloss ratio=2:12025.08 | 64 | |
| Moshi2025.08 | 62.3 | |
| Scaling InterleaveModel=9B, Train Params=9B, Data=600B tok2026.06 | 50.7 | |
| Scaling InterleaveModel=9B, Train Params=9B, Data=200B tok2026.06 | 44 | |
| Ours (8B)Model=8B, Train Params=~150M, Data=2.5k hrs2026.06 | 39.3 | |
| Scaling InterleaveModel=9B, Train Params=9B, Data=100B tok2026.06 | 37 | |
| Ours (4B)Model=4B, Train Params=~100M, Data=2.5k hrs2026.06 | 30.7 | |
| Spectron2025.08 | 21.9 | |
| SpeechGPT2025.08 | 21.6 | |
| MoshiModel=7B, Train Params=7B, Data=7M hrs2026.06 | 21 |