Text-to-Speech on Seed-TTS hard (test)
7.53WERSemantic-VAE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Semantic-VAEZero-shot=true2026.05 | 7.53 | 67 | |
| HoliTokZero-shot=true2026.05 | 7.59 | 66 | |
| MingTok-AudioZero-shot=true2026.05 | 14.75 | 66 | |
| HoliTok-UniteModeling=Unified spoken language modeling2026.05 | 16.79 | 62 | |
| HoliTok-BaseModeling=Unified spoken language modeling2026.05 | 30.44 | 61 | |
| MingTok-AudioModeling=Unified spoken language modeling2026.05 | 50.35 | 55 | |
| Semantic-VAEModeling=Unified spoken language modeling2026.05 | 97.31 | 61 |