Text-to-Speech on SeedTTS English (test)
1.69WERDiTAR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DiTAR#Params=600M, Data (hr)=100k2026.01 | 1.69 | 74 | — | |
| F5-TTS#Params=300M, Data (hr)=100k2026.01 | 1.83 | 65 | — | |
| SylFlow#Params=72M, Data (hr)=0.6k + 47k2026.01 | 1.92 | 35 | 4.31 | |
| SparkTTS#Params=500M, Data (hr)=100k2026.01 | 1.98 | 58 | — | |
| GT#Params=-, Data (hr)=-2026.01 | 2.14 | 73 | — | |
| CosyVoice 2#Params=500M, Data (hr)=170k2026.01 | 2.57 | 65 | — | |
| MaskGCT#Params=1048M, Data (hr)=100k2026.01 | 2.62 | 71 | — | |
| SylFlow#Params=72M, Data (hr)=0.6k2026.01 | 2.62 | 31 | 4.19 | |
| FireRedTTS#Params=580M, Data (hr)=248k2026.01 | 3.82 | 46 | — | |
| CosyVoice#Params=300M, Data (hr)=170k2026.01 | 4.08 | 64 | — | |
| Mel#Params=109M, Data (hr)=0.6k2026.01 | 4.48 | 18 | 3.38 | |
| Mimi#Params=74M, Data (hr)=0.6k2026.01 | 8.21 | 31 | 2.49 |