Spoken Dialogue on URO-Bench Chinese Basic Track
99.83Repeat ScoreStep-Audio 2 mini
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Step-Audio 2 mini2026.02 | 99.83 | 81.18 | 80.67 | 64.71 | 70.02 | 45.09 | 74.94 | 74.29 | 72.58 | 79.58 | |
| Qwen3-Omni2026.02 | 99.48 | 84.54 | 88.67 | 52.07 | 73.02 | 26.67 | 36.09 | 79.59 | 78.86 | 74.54 | |
| Covo-Audio-Chat-FDSetting=Autonomous full-duplex, Track=Chinese2026.02 | 98.35 | 80.72 | 83.67 | 75.16 | 79.37 | 70.7 | 78.85 | 84.9 | 83.93 | 88.34 | |
| Covo-Audio-Chat2026.02 | 98.17 | 79.89 | 88 | 77.34 | 83.6 | 68.42 | 80.69 | 90.02 | 87.18 | 90.41 | |
| Covo-Audio-ChatTTS_transferred=true2026.02 | 97.68 | 79.22 | 91 | 76.91 | 80.6 | 64.21 | 79.31 | 89.34 | 87.99 | 89.28 | |
| Fun-Audio-Chat2026.02 | 97.5 | 80.95 | 79 | 51.85 | 67.9 | 44.91 | 76.09 | 80.59 | 86.46 | 84.62 | |
| Step-Audio 2source=Wu et al., 2025a2026.02 | 96.16 | 79.16 | — | — | 74.06 | — | 62.99 | 76.23 | 84.54 | — | |
| GPT-4o Audiosource=Yan et al., 20252026.02 | 93.5 | 81.6 | 88 | 42.67 | 76 | 25.33 | 81.33 | 86.4 | 82.93 | 80 | |
| GLM-4-Voicesource=Yan et al., 20252026.02 | 92.64 | 77.08 | 69 | 28.75 | 56.96 | 15.78 | 78.85 | 83.35 | 82.12 | 84.48 | |
| Kimi-Audiosource=Wu et al., 2025a2026.02 | 73.32 | 78.4 | — | — | 66.93 | — | 52.45 | 69.9 | 81.81 | — | |
| Step-Audio-AQAAsource=Wu et al., 2025a2026.02 | 63.72 | 68.33 | — | — | 47.21 | — | 67.4 | 56.23 | 31.5 | — | |
| Qwen2.5-Omnisource=Wu et al., 2025a2026.02 | 19.66 | 73.22 | — | — | 67.7 | — | 61.76 | 70.4 | 79.71 | — | |
| Freeze-Omnisource=Yan et al., 20252026.02 | 4.97 | 71.82 | 7.66 | 9.58 | 16.4 | 11.75 | 47.35 | 67.98 | 64.89 | 71.28 | |
| Freeze-OmniSetting=Autonomous full-duplex, Track=Chinese2026.02 | 3.71 | 42.75 | 2.33 | 4.58 | 4.94 | 12.81 | 47.13 | 66.17 | 59.94 | 70.43 | |
| MiMo-Audio2026.02 | 0.44 | 79.61 | 92.67 | 35.73 | 83.6 | 61.05 | 38.16 | 85.9 | 89.1 | 84.84 |