Speech Synthesis on LibriTTS (test)
4.9134MOSEVA-GAN
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| EVA-GANsize=BIG2024.01 | 4.9134 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GROUND TRUTH2024.01 | 4.909 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BigVGANsize=BIG2024.01 | 4.8786 | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVA-GANsize=BASE2024.01 | 4.8687 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vocos2024.01 | 4.8577 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BigVGANsize=BASE2024.01 | 4.8545 | — | — | — | — | — | — | — | — | — | — | — | — | |
| HiFi-GANsize=BASE2024.01 | 4.8345 | — | — | — | — | — | — | — | — | — | — | — | — | |
| UnivNet-c32configuration=c322024.01 | 4.8042 | — | — | — | — | — | — | — | — | — | — | — | — | |
| HiFi-GANversion=V12024.01 | 4.7596 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ground Truth2022.05 | 4.1 | 5 | 0 | 0 | — | — | — | — | — | — | — | — | — | |
| RFWaveTraining dataset=LibriTTS2024.03 | 3.82 | — | — | — | — | 4.304 | 4.579 | 96.7 | 0.091 | — | — | — | — | |
| BigVGANTraining dataset=LibriTTS2024.03 | 3.78 | — | — | — | — | 4.24 | 4.712 | 97.8 | 0.067 | — | — | — | — | |
| VocosTraining dataset=LibriTTS2024.03 | 3.74 | — | — | — | — | 3.66 | 4.696 | 95.8 | 0.104 | — | — | — | — | |
| CUC-VAE2022.05 | 3.63 | 5.5 | 30.28 | 0.0217 | — | — | — | — | — | — | — | — | — | |
| Baseline+Global VAE2022.05 | 3.59 | 10.8 | 2.01 | 0.0054 | — | — | — | — | — | — | — | — | — | |
| Baseline2022.05 | 3.53 | 6 | 2.01 | 0.0054 | — | — | — | — | — | — | — | — | — | |
| Baseline+Fine-grained VAE2022.05 | 3.43 | 5.6 | 63.64 | 0.0901 | — | — | — | — | — | — | — | — | — | |
| APNet22026.03 | — | — | — | — | — | — | — | — | — | — | — | 54.95 | — | |
| Avocodo2026.03 | — | — | — | — | — | — | — | — | — | — | — | 68.16 | — | |
| BigVGANParams (M)=112.4, Training steps=5M2024.08 | — | — | — | — | 25.651 | — | — | — | — | — | — | — | — | |
| BigVGANParams (M)=112.42025.12 | — | — | — | — | — | 4.241 | 4.964 | 96.9 | 0.071 | 0.022 | — | — | — | |
| BigVGAN2026.03 | — | — | — | — | — | — | — | — | — | — | — | 79.33 | — | |
| BigVGAN-baseParams (M)=14.01, Training steps=5M2024.08 | — | — | — | — | 24.432 | — | — | — | — | — | — | — | — | |
| BigVGAN-base2026.03 | — | — | — | — | — | — | — | — | — | — | — | 74.27 | — | |
| BigVGAN-v2Params (M)=112.4, Training data scale=large-scale2025.12 | — | — | — | — | — | 4.379 | 4.971 | 97.8 | 0.055 | 0.014 | — | — | — | |
| Dasheng AudioGen2026.05 | — | 10.77 | — | — | — | — | — | — | — | — | — | — | 3.12 | |
| Flow2GANParams (M)=78.9, Inference steps=12025.12 | — | — | — | — | — | 4.189 | 4.957 | 97.5 | 0.063 | 0.028 | — | — | — | |
| Flow2GANParams (M)=78.9, Inference steps=22025.12 | — | — | — | — | — | 4.44 | 4.979 | 98.3 | 0.044 | 0.023 | — | — | — | |
| Flow2GANParams (M)=78.9, Inference steps=42025.12 | — | — | — | — | — | 4.484 | 4.986 | 98.5 | 0.037 | 0.016 | — | — | — | |
| GroundTruth2026.05 | — | 3 | — | — | — | — | — | — | — | — | — | — | 3.69 | |
| GT2026.03 | — | — | — | — | — | — | — | — | — | — | — | 89.45 | — | |
| GT2026.05 | — | 2.82 | — | — | — | — | — | — | — | — | — | — | 3.14 | |
| HiFiGAN-V12026.03 | — | — | — | — | — | — | — | — | — | — | — | 69.99 | — | |
| PeriodWaveParams (M)=29.8, Inference steps=16 steps, Training steps=1M2024.08 | — | — | — | — | 18.73 | — | — | — | — | — | — | — | — | |
| PeriodWave + FreeUParams (M)=29.8, Inference steps=16 steps, Training steps=1M2024.08 | — | — | — | — | 17.398 | — | — | — | — | — | — | — | — | |
| PeriodWave-MBParams (M)=37.08x4, Inference steps=16 steps, Training steps=1M2024.08 | — | — | — | — | 16.829 | — | — | — | — | — | — | — | — | |
| PeriodWave-TurboParams (M)=70.2, Inference steps=42025.12 | — | — | — | — | — | 4.434 | 4.965 | 95.8 | 0.096 | 0.02 | — | — | — | |
| PlanAudio2026.05 | — | 11 | — | — | — | — | — | — | — | — | — | — | 3.11 | |
| Prompt TTS++Type=Specialist baseline2026.05 | — | 12 | — | — | — | — | — | — | — | — | — | — | 3.51 | |
| Qwen3-TTS2026.05 | — | 2.15 | — | — | — | — | — | — | — | — | — | — | 3.4 | |
| Reconstruction2026.05 | — | 4 | — | — | — | — | — | — | — | — | — | — | 3.13 | |
| RFWaveParams (M)=18.1, Inference steps=102025.12 | — | — | — | — | — | 4.22 | 4.772 | 95.7 | 0.098 | 0.412 | — | — | — | |
| RNDVoC-nonshared2026.03 | — | — | — | — | — | — | — | — | — | — | — | 78.76 | — | |
| RNDVoC-shared2026.03 | — | — | — | — | — | — | — | — | — | — | — | 80.74 | — | |
| UnivNet-c32Params (M)=14.872024.08 | — | — | — | — | 53.021 | — | — | — | — | — | — | — | — | |
| VocosParams (M)=13.532024.08 | — | — | — | — | 24.075 | — | — | — | — | — | — | — | — | |
| VocosParams (M)=13.52025.12 | — | — | — | — | — | 3.618 | 4.898 | 95.1 | 0.105 | 0.042 | — | — | — | |
| Vocos2026.03 | — | — | — | — | — | — | — | — | — | — | — | 73.18 | — | |
| VoiceLDM-mModel Size=medium2026.05 | — | 13 | — | — | — | — | — | — | — | — | — | — | 2.99 | |
| VoiceLDM-sModel Size=small2026.05 | — | 62 | — | — | — | — | — | — | — | — | — | — | 2.75 | |
| WaveFMParams (M)=19.5, Inference steps=12025.12 | — | — | — | — | — | 3.54 | 4.894 | 94.3 | 0.124 | 0.098 | — | — | — |