Text-to-Speech on Seed-TTS Seed-EN (test)
0.0147WERARCHI-TTS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ARCHI-TTS2026.02 | 0.0147 | 0.68 | |
| DiTAR2026.02 | 0.0169 | 0.74 | |
| SemaVoiceType=C-AR, Params=1.5B, #Hours=150K2026.05 | 0.0171 | 0.694 | |
| Seed-TTS_DiT2026.02 | 0.0173 | 0.79 | |
| F5-TTS2026.02 | 0.0183 | 0.67 | |
| VoxCPMType=C-AR, Params=0.5B, #Hours=1.8M2026.05 | 0.0185 | 0.729 | |
| SemaVoice-EmiliaType=C-AR, Params=1.5B, #Hours=100K2026.05 | 0.0191 | 0.657 | |
| OpenAudio-s1Type=D-AR, Params=0.5B, #Hours=2.0M2026.05 | 0.0194 | 0.55 | |
| FireRedTTS-2Type=D-AR, Params=-, #Hours=1.4M2026.05 | 0.0195 | 0.665 | |
| SparkTTSType=D-AR, Params=0.5B, #Hours=100K2026.05 | 0.0198 | 0.573 | |
| F5-TTSType=C-NAR, Params=0.3B, #Hours=100K2026.05 | 0.02 | 0.647 | |
| Ground Truth2026.02 | 0.0206 | 0.73 | |
| VAE Resynthesized2026.02 | 0.0206 | 0.7 | |
| Vocos Resynthesized2026.02 | 0.0209 | 0.7 | |
| Ground TruthType=-, Params=-, #Hours=-2026.05 | 0.0214 | 0.734 | |
| E2 TTS2026.02 | 0.0219 | 0.71 | |
| IndexTTS 2Type=D-AR+C-NAR, Params=1.5B, #Hours=55K2026.05 | 0.0223 | 0.706 | |
| VoxCPM-EmiliaType=C-AR, Params=0.5B, #Hours=100K2026.05 | 0.0234 | 0.681 | |
| HiggsAudio-v2Type=D-AR, Params=3.0B, #Hours=10M2026.05 | 0.0244 | 0.677 | |
| CosyVoice 22026.02 | 0.0257 | 0.65 | |
| CosyVoice2Type=D-AR+C-NAR, Params=0.5B, #Hours=170K2026.05 | 0.0257 | 0.659 | |
| MaskGCTType=D-NAR, Params=1.0B, #Hours=100K2026.05 | 0.0262 | 0.717 | |
| MaskGCT2026.02 | 0.0262 | 0.717 | |
| Qwen2.5-OmniType=MLLM, Params=7.0B, #Hours=-2026.05 | 0.0272 | 0.632 | |
| VibeVoiceType=C-AR, Params=1.5B, #Hours=-2026.05 | 0.0304 | 0.689 | |
| FireRedTTS2026.02 | 0.0382 | 0.46 | |
| FireRedTTSType=D-AR+C-NAR, Params=0.5B, #Hours=248K2026.05 | 0.0382 | 0.46 | |
| CosyVoiceType=D-AR+C-NAR, Params=0.3B, #Hours=170K2026.05 | 0.0429 | 0.609 | |
| HoliTok-UniteModeling=Unified spoken language modeling2026.05 | 0.072 | 0.55 | |
| HoliTok-BaseModeling=Unified spoken language modeling2026.05 | 0.2785 | 0.52 | |
| MingTok-AudioModeling=Unified spoken language modeling2026.05 | 0.5106 | 0.42 | |
| Semantic-VAEModeling=Unified spoken language modeling2026.05 | 1.0232 | 0.47 |