Text-to-Speech on Seed ZH
0.77CERQwen3-TTS-12Hz-1.7B-Base
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-BaseToken rate=12 Hz2026.06 | 0.77 | — | |
| Ming-omni-tts-16.8B-A3BToken rate=12.5→3.1 Hz2026.06 | 0.83 | 75 | |
| CosyVoice3.5Model Architecture Type=AR/Hybrid2026.03 | 0.87 | 79.7 | |
| Ming-omni-tts-0.5BToken rate=12.5→3.1 Hz2026.06 | 0.87 | 72 | |
| F3-Tokenizer-LLM (4B)Token rate=25→12.5 Hz2026.06 | 0.9 | 76 | |
| Qwen3-TTS-12Hz-0.6B-BaseToken rate=12 Hz2026.06 | 0.92 | — | |
| VoxCPMModel Architecture Type=AR/Hybrid2026.03 | 0.93 | 77.2 | |
| Ming-UniAudio-16B-A3BToken rate=50→10 Hz2026.06 | 0.95 | 70 | |
| MiniMax-SpeechModel Architecture Type=AR/Hybrid2026.03 | 0.99 | 79.9 | |
| Ming-Flash-Omni-previewToken rate=12.5→3.1 Hz2026.06 | 0.99 | 74 | |
| DiTARModel Architecture Type=AR/Hybrid2026.03 | 1.02 | 75.3 | |
| IndexTTS2Model Architecture Type=AR/Hybrid2026.03 | 1.03 | 76.5 | |
| FireRedTTS-1SModel Architecture Type=AR/Hybrid2026.03 | 1.05 | 75 | |
| LongCat-AudioDiT-3.5BNumber of Parameters=3.5B2026.03 | 1.09 | 81.8 | |
| Qwen3-TTS-25Hz-1.7B-BaseToken rate=25 Hz2026.06 | 1.1 | — | |
| Seed-ICLModel Architecture Type=AR/Hybrid2026.03 | 1.12 | 79.6 | |
| CosyVoice3-1.5BModel Architecture Type=AR/Hybrid, Number of Parameters=1.5B2026.03 | 1.12 | 78.1 | |
| CosyVoice 3-1.5BToken rate=25 Hz2026.06 | 1.12 | 78.1 | |
| VibeVoice-1.5BToken rate=7.5 Hz2026.06 | 1.16 | 74.4 | |
| Seed-DiTModel Architecture Type=NAR2026.03 | 1.18 | 80.9 | |
| LongCat-AudioDiT-1BNumber of Parameters=1B2026.03 | 1.18 | 81.2 | |
| Qwen3-TTS-25Hz-0.6B-BaseToken rate=25 Hz2026.06 | 1.18 | — | |
| SparkTTSModel Architecture Type=AR/Hybrid2026.03 | 1.2 | 67.2 | |
| MOSS-TTSModel Architecture Type=AR/Hybrid2026.03 | 1.2 | 78.8 | |
| Qwen3-TTSModel Architecture Type=AR/Hybrid2026.03 | 1.22 | 77 | |
| GT2026.03 | 1.26 | 75.5 | |
| F5R-TTSModel Architecture Type=NAR2026.03 | 1.37 | 75.4 | |
| joint residual reweighting (Ours)Backbone=CosyVoice2 [8], Branches=42026.06 | 1.39 | 76.31 | |
| ZipVoiceModel Architecture Type=NAR2026.03 | 1.4 | 75.1 | |
| CFG (strength=1.0)Backbone=CosyVoice2 [8], Branches=22026.06 | 1.44 | 75.47 | |
| CosyVoice2Model Architecture Type=AR/Hybrid2026.03 | 1.45 | 74.8 | |
| joint residual reweighting (Ours)Backbone=F5-TTS [1], Branches=42026.06 | 1.53 | 76.3 | |
| CFG (strength=0.7)Backbone=CosyVoice2 [8], Branches=22026.06 | 1.53 | 75.31 | |
| F5 TTSModel Architecture Type=NAR2026.03 | 1.56 | 74.1 | |
| CFG (strength=1.5)Backbone=F5-TTS [1], Branches=22026.06 | 1.57 | 76.09 | |
| CFG (strength=2.0)Backbone=F5-TTS [1], Branches=22026.06 | 1.58 | 76.36 | |
| Qwen2.5-OmniModel Architecture Type=AR/Hybrid2026.03 | 1.7 | 75.2 | |
| Selective CFG†Backbone=CosyVoice2 [8], Branches=22026.06 | 1.8 | 76.3 | |
| Selective CFG†Backbone=F5-TTS [1], Branches=22026.06 | 1.9 | 76.4 | |
| E2 TTSModel Architecture Type=NAR2026.03 | 1.97 | 73 | |
| MaskGCTModel Architecture Type=NAR2026.03 | 2.27 | 77.4 | |
| CosyVoiceModel Architecture Type=AR/Hybrid2026.03 | 3.63 | 72.3 |