Text-to-Speech on AISHELL-3 (test)
4.18MOSRecording
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Recording2026.06 | 4.18 | — | — | — | — | |
| CosyVoice(50k)Training dataset=50k hours2026.06 | 4.06 | — | — | — | — | |
| dynamic prosody predictionTraining dataset=50k hours, alpha=0.52026.06 | 4.06 | — | — | — | — | |
| CoTTraining dataset=50k hours2026.06 | 4.03 | — | — | — | — | |
| Proposed modelModel A=Vevo1.52026.06 | — | 23.2 | 41.2 | 35.6 | 0.01 | |
| Proposed modelModel A=F5-TTS2026.06 | — | 21.4 | 50 | 28.6 | 0.01 | |
| Proposed modelModel A=CosyVoice2026.06 | — | 29.1 | 43.2 | 27.7 | 0.65 |