Text-to-Speech on SEED-TTS (en/zh/avg)
0.792SIM (en)UniAudio-Token
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| UniAudio-TokenBackbone=Qwen2.5-0.5B, Speaker embedding conditioning=CAM++, Speaker similarity evaluation model=ERes2Net2026.05 | 0.792 | 0.742 | 0.767 | 1.78 | 1.29 | 1.54 | 4.07 | 3.68 | 3.88 | |
| CosyVoice2Backbone=Qwen2.5-0.5B, Speaker embedding conditioning=CAM++, Speaker similarity evaluation model=ERes2Net2026.05 | 0.758 | 0.762 | 0.76 | 2.71 | 1.39 | 2.05 | 3.75 | 3.37 | 3.56 |