Spoken dialogue generation on TTSD ZH (test)
97.36AccuracyMOSS-TTSD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MOSS-TTSDReference Speaker Timbre=ElevenLabs2026.03 | 97.36 | 0.8165 | 3.91 | |
| Eleven V32026.03 | 96.53 | 0.697 | 3.63 | |
| MOSS-TTSDReference Speaker Timbre=Doubao2026.03 | 96.3 | 0.8226 | 5.71 | |
| Doubao_Podcast2026.03 | 96.06 | 0.8034 | 4.72 | |
| MOSS-TTSDContext=Open-Source Models comparison2026.03 | 95.87 | 0.7949 | 4.85 | |
| VibeVoiceModel Size=7B2026.03 | 92.22 | 0.759 | 5.7 | |
| FireRedTTS-22026.03 | 90.22 | 0.7383 | 7.68 | |
| VibeVoiceModel Size=1.5B2026.03 | 87.98 | 0.7415 | 8.18 |