Text-to-Speech on Internal Chinese speech dataset 1.0 (test)
4.03NMOSIndexTTS2
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| IndexTTS2Params=1.0B, Txt@Spk=false, Aud@Spk=true2025.12 | 4.03 | 4.09 | 54 | 40 | 70 | 0.76 | 2.8 | |
| CosyVoice2Params=0.5B, Txt@Spk=true, Aud@Spk=false2025.12 | 3.92 | 3.95 | 33 | 31 | 52 | 0.8 | 4.6 | |
| GTParams=N/A, Txt@Spk=N/A, Aud@Spk=N/A2025.12 | 3.86 | 3.89 | 68 | 100 | 100 | — | 2.8 | |
| CosyVoiceParams=0.3B, Txt@Spk=true, Aud@Spk=false2025.12 | 3.83 | 4.02 | 29 | 22 | 51 | 0.68 | 5.9 | |
| DMP-TTSPrompting=Audio, Params=0.3B, Txt@Spk=true, Aud@Spk=true2025.12 | 3.82 | 3.83 | 55 | 82 | 74 | 0.72 | 4.3 | |
| GT-ReconParams=N/A, Txt@Spk=N/A, Aud@Spk=N/A2025.12 | 3.74 | 3.62 | 62 | 80 | 97 | — | 3 | |
| DMP-TTSPrompting=Text, Params=0.3B, Txt@Spk=true, Aud@Spk=true2025.12 | 3.73 | 3.77 | 64 | 85 | 73 | 0.71 | 3.8 |