Text-to-Speech on North American English TTS dataset single-speaker (test)
4.55MOSNatural
Evaluation Results
| Method | Links | |
|---|---|---|
| NaturalEncoding=16-bit linear PCM2016.09 | 4.55 | |
| NaturalEncoding=8-bit mu-law2016.09 | 4.46 | |
| WaveNetConditioning=L+F (Linguistic features + log F0)2016.09 | 4.21 | |
| HMM-driven concatenativeArchitecture=Unit selection concatenative2016.09 | 3.86 | |
| LSTM-RNN parametricArchitecture=Statistical parametric2016.09 | 3.67 |