Text-to-Speech on LJSpeech (Overall RTF)
0.0033Overall RTFProposed Method (FS2 + Mimi)
Evaluation Results
| Method | Links | |
|---|---|---|
| Proposed Method (FS2 + Mimi)Acoustic Model=FastSpeech 2 (Modified), Vocoder=Mimi2026.04 | 0.0033 | |
| VITSAcoustic Model=VITS, Vocoder=None (End-to-End)2026.04 | 0.02 | |
| Baseline 1Acoustic Model=FastSpeech 2, Vocoder=HiFi-GAN2026.04 | 0.025 | |
| Baseline 2Acoustic Model=FastSpeech 2, Vocoder=Parallel WaveGAN2026.04 | 0.035 |