Text-to-Speech on Seed-TTS Hard
6.83CERCosyVoice2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CosyVoice2Type=D-AR+C-NAR, Params=0.5B, #Hours=170K2026.05 | 6.83 | 72.4 | |
| IndexTTS 2Type=D-AR+C-NAR, Params=1.5B, #Hours=55K2026.05 | 7.12 | 75.5 | |
| Qwen2.5-OmniType=MLLM, Params=7.0B, #Hours=-2026.05 | 7.97 | 74.7 | |
| SemaVoiceType=C-AR, Params=1.5B, #Hours=150K2026.05 | 8.09 | 71.1 | |
| F5-TTSType=C-NAR, Params=0.3B, #Hours=100K2026.05 | 8.67 | 71.3 | |
| VoxCPMType=C-AR, Params=0.5B, #Hours=1.8M2026.05 | 8.87 | 73 | |
| SemaVoice-EmiliaType=C-AR, Params=1.5B, #Hours=100K2026.05 | 9.37 | 68.7 | |
| CosyVoiceType=D-AR+C-NAR, Params=0.3B, #Hours=170K2026.05 | 11.75 | 70.9 | |
| VoxCPM-EmiliaType=C-AR, Params=0.5B, #Hours=100K2026.05 | 12.46 | 69.8 | |
| FireRedTTSType=D-AR+C-NAR, Params=0.5B, #Hours=248K2026.05 | 17.45 | 62.1 | |
| OpenAudio-s1Type=D-AR, Params=0.5B, #Hours=2.0M2026.05 | 23.37 | 64.3 | |
| HiggsAudio-v2Type=D-AR, Params=3.0B, #Hours=10M2026.05 | 55.07 | 65.6 |