Cross-speaker style transfer on ESD (test)
3.638nMOSGT
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GTSpeaker Encoder=-, Emotion Encoder=-2026.03 | 3.638 | 3.541 | 4.009 | — | — | — | — | |
| E3-VITSSpeaker Encoder=Lookup, Emotion Encoder=StyleSpeech2026.03 | 2.763 | 2.237 | 2.815 | 3.9614 | 20.11 | 80.69 | 53.67 | |
| SelfTTSSpeaker Encoder=RE, Emotion Encoder=RE2026.03 | 2.746 | 2.853 | 3.112 | 3.6104 | 23.05 | 81.63 | 84.23 | |
| VECLSpeaker Encoder=HSAP, Emotion Encoder=CNN-based2026.03 | 2.707 | 2.556 | 2.804 | 3.7959 | 19.44 | 78.06 | 69.29 | |
| SelfTTS w/o Self-Aug.Speaker Encoder=RE, Emotion Encoder=RE2026.03 | 2.228 | 2.849 | 3.121 | 3.4899 | 25.67 | 81.03 | 87.93 |