Singing Voice Synthesis on M4Singer and Opencpop (OD)
4.5PESQGround Truth
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Ground Truth2025.12 | 4.5 | 0 | — | — | |
| iSTFTNet + UnivHDVocoder=iSTFTNet, Discriminator=UnivHD (+H)2025.12 | 2.9 | 2.25 | 38.79 | — | |
| iSTFTNet + MS-SB-CQTVocoder=iSTFTNet, Discriminator=MS-SB-CQT (+C)2025.12 | 2.87 | 2.31 | 40.2 | — | |
| HiFiGAN + UnivHDVocoder=HiFiGAN, Discriminator=UnivHD (+H)2025.12 | 2.85 | 2.54 | 43.04 | — | |
| iSTFTNet + MS-STFTVocoder=iSTFTNet, Discriminator=MS-STFT (+S)2025.12 | 2.82 | 2.34 | 43.95 | — | |
| iSTFTNetVocoder=iSTFTNet, Discriminator=Original2025.12 | 2.81 | 2.39 | 49.03 | — | |
| HiFiGAN + MS-SB-CQTVocoder=HiFiGAN, Discriminator=MS-SB-CQT (+C)2025.12 | 2.74 | 2.67 | 44.96 | — | |
| HiFiGAN + MS-STFTVocoder=HiFiGAN, Discriminator=MS-STFT (+S)2025.12 | 2.7 | 2.68 | 46.08 | — | |
| HiFiGANVocoder=HiFiGAN, Discriminator=Original2025.12 | 2.66 | 2.69 | 50.96 | — |