Text-to-Speech Synthesis on LJSpeech (MOS, WER)
4.48MOSFNH-TTS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FNH-TTSModel Size=47.73M, Discriminator Size=27.07M, Components=MoE-DP + CMoBD + SBD + VOCOS2025.08 | 4.48 | 2.59 | |
| VITS Origin w/ CMoBD + SBD + VOCOSModel Size=40.89M, Discriminator Size=27.07M2025.08 | 4.44 | 2.6 | |
| StyleTTS2Model Size=145.53M, Discriminator Size=41.38M2025.08 | 4.35 | 5.78 | |
| VITS Origin w/ CMoBD + SBDModel Size=39.53M, Discriminator Size=27.07M2025.08 | 4.32 | 2.69 | |
| VITS OriginModel Size=39.53M, Discriminator Size=46.75M2025.08 | 4.26 | 3.41 | |
| VITS w/ MoE-DP + CMoBD + SBDModel Size=46.37M, Discriminator Size=27.07M2025.08 | 4.2 | 2.42 | |
| FastSpeech2Model Size=34.64M, Discriminator Size=42.53M2025.08 | 4.12 | 7.02 | |
| SparkTTSModel Size=506.63M2025.08 | 4.1 | 7.36 | |
| VITS w/ MoE-DPModel Size=46.37M, Discriminator Size=46.75M2025.08 | 3.92 | 6.48 | |
| F5-TTSModel Size=337.09M2025.08 | 3.87 | 8.7 | |
| VITS w/ MoE-DP + VOCOSModel Size=47.73M, Discriminator Size=46.75M2025.08 | 3.75 | 9.74 |