Streaming Speech Generation on Streaming generation scenarios 0.6s speech chunk
368.67First-chunk Latency (ms)VocalNet-MDM
Evaluation Results
| Method | Links | |
|---|---|---|
| VocalNet-MDMDiffusion steps=1, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 368.67 | |
| VocalNet-MDMDiffusion steps=2, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 373.29 | |
| VocalNet-MDMDiffusion steps=4, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 382.36 | |
| VocalNet-MDMDiffusion steps=8, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 402.19 | |
| VocalNet-MDMDiffusion steps=16, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 427.45 | |
| VocalNet-8BHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 462.32 | |
| Baseline-ARTraining objective=MTP, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 481.22 | |
| VITA-AudioHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 512.64 | |
| Baseline-ARTraining objective=NTP, Hardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 555.86 | |
| SLAM-OmniHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 742.32 | |
| GLM-4-VoiceHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 1,066.02 | |
| MiniCPM-oHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 1,329.52 | |
| Kimi-AudioHardware=single L20 GPU, Speech chunk length=0.6s2026.02 | 1,371.48 |