Text-to-Speech on LJSpeech (test)
86.67CMOSOscillaTTS
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| OscillaTTSactivation=Oscilla2026.06 | 86.67 | — | — | — | — | 6.59 | 0.35 | |
| GRADTTS2026.06 | 83.78 | — | — | — | — | 6.9 | 0.35 | |
| StyleTTS22026.06 | 81.48 | — | — | — | — | 6.64 | 0.41 | |
| FASTSPEECH22026.06 | 76 | — | — | — | — | 6.62 | 0.35 | |
| GlowTTS2026.06 | 75.79 | — | — | — | — | 6.85 | 0.4 | |
| Glow-TTSSampling Temperature (T)=0.3332020.05 | 0.934 | — | — | — | — | — | — | |
| Tacotron 22020.05 | 0 | — | — | — | — | — | — | |
| NaturalSpeech2022.05 | 0 | — | — | — | — | — | — | |
| Human Recordings2022.05 | 0 | — | — | — | — | — | — | |
| Human Recordings2022.05 | 0 | — | — | — | — | — | — | |
| FastSpeech 22020.06 | 0 | — | — | — | — | — | — | |
| FastSpeech 2Vocoder=Mel + PWG2020.06 | 0 | 3.83 | — | — | — | — | — | |
| NaturalSpeech2022.05 | -0.01 | — | 0.6902 | — | — | — | — | |
| VITS2022.05 | -0.19 | — | 0.2429 | — | — | — | — | |
| VITSVocoder Fine-tuning=on predicted mel-spectrograms2022.05 | -0.2 | — | — | — | — | — | — | |
| Glow-TTS + HiFiGANVocoder=HiFiGAN (fine-tuned)2022.05 | -0.23 | — | 0 | — | — | — | — | |
| Grad-TTS + HiFiGANInference steps=1000, Vocoder=HiFiGAN (fine-tuned)2022.05 | -0.23 | — | 0.0127 | — | — | — | — | |
| Transformer TTS2020.06 | -0.235 | — | — | — | — | — | — | |
| Transformer TTSVocoder=Mel + PWG2020.06 | -0.235 | 3.72 | — | — | — | — | — | |
| Grad-TTSVocoder=HiFiGAN, Vocoder Fine-tuning=on predicted mel-spectrograms2022.05 | -0.24 | — | — | — | — | — | — | |
| Glow-TTSVocoder=HiFiGAN, Vocoder Fine-tuning=on predicted mel-spectrograms2022.05 | -0.26 | — | — | — | — | — | — | |
| FastSpeech 2 + HiFiGANVocoder=HiFiGAN (fine-tuned)2022.05 | -0.3 | — | 0 | — | — | — | — | |
| FastSpeech 2Vocoder=HiFiGAN, Vocoder Fine-tuning=on predicted mel-spectrograms2022.05 | -0.33 | — | — | — | — | — | — | |
| FastSpeech2020.06 | -0.885 | — | — | — | — | — | — | |
| FastSpeechVocoder=Mel + PWG2020.06 | -0.885 | 3.68 | — | — | — | — | — | |
| Baseline (FS2 + PWG)System=Baseline (FS2 + PWG), Description=Non-streaming, Continuous Mel-spec + Vocoder2026.04 | — | 2.81 | — | 0.13 | — | — | — | |
| FastSpeech 2 (Baseline)Description=Text→FastSpeech 2→HiFi-GAN Vocoder2026.04 | — | — | — | — | 5.19 | — | — | |
| FastSpeech 2s2020.06 | — | 3.71 | — | — | — | — | — | |
| Ground Truth (LJSpeech)System=Ground Truth (LJSpeech), Description=Original high-fidelity recordings2026.04 | — | 4.51 | — | 0.08 | — | — | — | |
| GT2020.06 | — | 4.3 | — | — | — | — | — | |
| GTVocoder=Mel + PWG2020.06 | — | 3.92 | — | — | — | — | — | |
| GTTSTemperature=0.667, Pre-net dropout=false, Model size=28.6M2022.11 | — | 2.64 | — | — | — | — | — | |
| NHMMTemperature=0, Pre-net dropout=true, Model size=15.3M2022.11 | — | 2.97 | — | — | — | — | — | |
| OverFlow (OF)Temperature=0.667, Pre-net dropout=true, Model size=28.5M2022.11 | — | 3.43 | — | — | — | — | — | |
| OverFlow (OFND)Temperature=0.667, Pre-net dropout=false, Model size=28.5M2022.11 | — | 3.25 | — | — | — | — | — | |
| OverFlow (OFZT)Temperature=0, Pre-net dropout=false, Model size=28.5M2022.11 | — | 3.01 | — | — | — | — | — | |
| Proposed Method (FS2 + Mimi)System=Proposed Method (FS2 + Mimi), Description=Streaming, Discrete Tokens, End-to-End2026.04 | — | 2.51 | — | 0.11 | — | — | — | |
| Proposed Method (FS2 + Mimi)Description=Text→FastSpeech2→Mimi Tokens→Decoder2026.04 | — | — | — | — | 8.89 | — | — | |
| T2Temperature=N/A, Pre-net dropout=true, Model size=28.2M2022.11 | — | 3.25 | — | — | — | — | — | |
| Tacotron 2Vocoder=Mel + PWG2020.06 | — | 3.7 | — | — | — | — | — | |
| Topline (Mimi Reconstruction)Description=Ground Truth→Mimi Encoder→Decoder2026.04 | — | — | — | — | 1.34 | — | — | |
| VITS (Baseline)Description=End-To-End Generative Model2026.04 | — | — | — | — | 1.64 | — | — | |
| VOCCondition=Vocoded speech reference2022.11 | — | 4.18 | — | — | — | — | — |