Text-to-Speech on Seed-TTS English (test)
1.47WERUniSonate
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UniSonateParams=1.3B, Data Scale=50k hrs (S) + 20k hrs (M) + 1.5M clips (E), Sampling Rate=44.1kHz2026.04 | 1.47 | — | — | |
| InstructAudioParams=1.3B, Data Scale=50k hrs (S) + 20k hrs (M), Sampling Rate=44.1kHz2026.04 | 1.52 | — | — | |
| ZipVoiceParams=123M, Data Scale=100k hrs (S), Sampling Rate=44.1kHz2026.04 | 1.7 | — | — | |
| F5-TTSParams=336M, Data Scale=100k hrs (S), Sampling Rate=44.1kHz2026.04 | 1.89 | — | — | |
| Ori. speechzero-shot=false2025.09 | 2.14 | 0.722 | — | |
| Ground Truth2026.04 | 2.14 | — | — | |
| MaskGCTParams=1B, Data Scale=100k hrs (S), Sampling Rate=44.1kHz2026.04 | 2.26 | — | — | |
| E2-TTSParams=333M, Data Scale=100k hrs (S), Sampling Rate=44.1kHz2026.04 | 2.49 | — | — | |
| CosyVoice2Model size=0.5B, Data size=167k, zero-shot=true2025.09 | 2.57 | 0.652 | 2.34 | |
| CosyVoice2Params=618M, Data Scale=167k hrs (S), Sampling Rate=44.1kHz2026.04 | 2.57 | — | — | |
| MSR-Codec-524Model size=0.2B, Data size=45k, zero-shot=true2025.09 | 3.07 | 0.613 | 0.67 | |
| Llasa-1B-250kModel size=1B, Data size=250k, zero-shot=true2025.09 | 3.22 | 0.572 | 0.91 | |
| FireRedTTSModel size=0.4B, Data size=150k, zero-shot=true2025.09 | 3.82 | 0.46 | 1.48 | |
| CosyVoice1Params=416M, Data Scale=170k hrs (S), Sampling Rate=44.1kHz2026.04 | 4.29 | — | — |