Text-to-Speech on Speech Synthesis Inference Laboratory Setting
0.12RTFManchuTTS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ManchuTTSHardware=RTX 4090, Batch size=1, Precision=FP162025.12 | 0.12 | 86 | 4.1 | 8 | |
| F5-TTSHardware=RTX 4090, Batch size=1, Precision=FP162025.12 | 0.21 | 122 | 5.9 | 5 | |
| FastSpeech2 + HiFi-GANHardware=RTX 4090, Batch size=1, Precision=FP162025.12 | 0.34 | 210 | 7.4 | 3 | |
| Glow-TTSHardware=RTX 4090, Batch size=1, Precision=FP162025.12 | 0.47 | 175 | 6.8 | 2 | |
| Tacotron2 + WaveGlowHardware=RTX 4090, Batch size=1, Precision=FP162025.12 | 0.89 | 520 | 9.7 | 1 |