Speech Synthesis on VCTK (OD)
4.5PESQGround Truth
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Ground Truth2025.12 | 4.5 | 0 | — | — | |
| HiFiGAN + UnivHDVocoder=HiFiGAN, Discriminator=UnivHD (+H)2025.12 | 2.91 | 1.69 | 42.88 | — | |
| iSTFTNet + UnivHDVocoder=iSTFTNet, Discriminator=UnivHD (+H)2025.12 | 2.88 | 1.56 | 45.89 | — | |
| iSTFTNet + MS-SB-CQTVocoder=iSTFTNet, Discriminator=MS-SB-CQT (+C)2025.12 | 2.84 | 1.63 | 46.71 | — | |
| HiFiGAN + MS-STFTVocoder=HiFiGAN, Discriminator=MS-STFT (+S)2025.12 | 2.82 | 1.76 | 50.23 | — | |
| HiFiGAN + MS-SB-CQTVocoder=HiFiGAN, Discriminator=MS-SB-CQT (+C)2025.12 | 2.82 | 1.7 | 44.77 | — | |
| HiFiGANVocoder=HiFiGAN, Discriminator=Original2025.12 | 2.81 | 1.75 | 53.43 | — | |
| iSTFTNetVocoder=iSTFTNet, Discriminator=Original2025.12 | 2.81 | 1.68 | 52.91 | — | |
| iSTFTNet + MS-STFTVocoder=iSTFTNet, Discriminator=MS-STFT (+S)2025.12 | 2.79 | 1.72 | 49.27 | — |