Speech-to-Speech Question Answering on Llama Questions
79.33AccuracyFreezeEmpath
Evaluation Results
| Method | Links | |
|---|---|---|
| FreezeEmpathModality=S2T2026.04 | 79.33 | |
| Kimi-AudioModality=S2T2026.04 | 79 | |
| VocalNetModel Parameters=8B2026.03 | 78.6 | |
| Fun-Audio-Chat-8BModality=S2T2026.04 | 77.76 | |
| Qwen2.5-Omni-7BModel Parameters=7B2026.03 | 77.33 | |
| AudioKVModel=Qwen2.5-Omni-7B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 77.3 | |
| PyramidKVModel=Qwen2.5-Omni-7B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 76.7 | |
| SnapKVModel=Qwen2.5-Omni-7B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 76 | |
| AdaKVModel=Qwen2.5-Omni-7B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 76 | |
| AudioKVModel=Qwen2.5-Omni-3B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 75 | |
| AdaKVModel=Qwen2.5-Omni-3B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 74.7 | |
| PyramidKVModel=Qwen2.5-Omni-3B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 74.7 | |
| FreezeEmpathModality=S2S2026.04 | 74.67 | |
| LLaMA-Omni2-7BModality=S2T2026.04 | 73.67 | |
| SPEECH-OMNI-LITEModel Parameters=8B2026.03 | 73.33 | |
| LLaMA-Omni2Model Parameters=7B2026.03 | 72 | |
| SnapKVModel=Qwen2.5-Omni-3B, KV cache budget=40%, max_gen_tokens=64, Judge=Gemini 2.5 Flash2026.04 | 72 | |
| Fun-Audio-Chat-8BModality=S2S2026.04 | 72 | |
| OpenS2SModality=S2T2026.04 | 70.67 | |
| Step-Audio2-MiniModality=S2T2026.04 | 66.67 | |
| LLaMA-Omni2-7BModality=S2S2026.04 | 66.67 | |
| Baichuan-Omni-1.5Model Parameters=7B2026.03 | 65.67 | |
| Kimi-AudioModality=S2S2026.04 | 64.67 | |
| Step-Audio2-MiniModality=S2S2026.04 | 64.33 | |
| GLM-4-VoiceModel Parameters=9B2026.03 | 63.67 | |
| OpenS2SModality=S2S2026.04 | 59 | |
| Freeze-OmniModel Parameters=7B2026.03 | 58.67 |