Text-to-Speech Synthesis on VCTK
4.63MOSFNH-TTS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FNH-TTSModel Size=47.73M, Discriminator Size=27.07M, Components=MoE-DP + CMoBD + SBD + VOCOS2025.08 | 4.63 | 3.88 | |
| VITS Origin w/ CMoBD + SBDModel Size=39.53M, Discriminator Size=27.07M2025.08 | 4.5 | 4 | |
| F5-TTSModel Size=337.09M2025.08 | 4.49 | 2.24 | |
| VITS w/ MoE-DP + CMoBD + SBDModel Size=46.37M, Discriminator Size=27.07M2025.08 | 4.43 | 3.6 | |
| SparkTTSModel Size=506.63M2025.08 | 4.38 | 4.98 | |
| VITS OriginModel Size=39.53M, Discriminator Size=46.75M2025.08 | 4.34 | 4.11 | |
| VITS Origin w/ CMoBD + SBD + VOCOSModel Size=40.89M, Discriminator Size=27.07M2025.08 | 4.27 | 4.96 | |
| VITS w/ MoE-DP + VOCOSModel Size=47.73M, Discriminator Size=46.75M2025.08 | 3.95 | 10.58 | |
| VITS w/ MoE-DPModel Size=46.37M, Discriminator Size=46.75M2025.08 | 3.9 | 7.04 |