Target-Speaker Multilingual Speech Generation on TTS multilingual Italian (test)
1.194WERGPT-4o-Audio Preview
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o-Audio Preview2026.01 | 1.194 | |
| Qwen3-TTSTokenizer Frequency=25Hz, Parameters=1.7B, Evaluation Protocol=CustomVoice2026.01 | 1.271 | |
| Qwen3-TTSTokenizer Frequency=12Hz, Parameters=1.7B, Evaluation Protocol=CustomVoice2026.01 | 1.362 | |
| Qwen3-TTSTokenizer Frequency=25Hz, Parameters=0.6B, Evaluation Protocol=CustomVoice2026.01 | 1.861 | |
| Qwen3-TTSTokenizer Frequency=12Hz, Parameters=0.6B, Evaluation Protocol=CustomVoice2026.01 | 2.545 |