Text-to-Speech on Seed EN
1.23WERQwen3-TTS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-TTSModel Architecture Type=AR/Hybrid2026.03 | 1.23 | 71.7 | |
| Qwen3-TTS-12Hz-1.7B-BaseToken rate=12 Hz2026.06 | 1.24 | — | |
| Qwen3-TTS-12Hz-0.6B-BaseToken rate=12 Hz2026.06 | 1.32 | — | |
| CFG (strength=2.0)Backbone=F5-TTS [1], Branches=22026.06 | 1.36 | 0.6811 | |
| CFG (strength=1.5)Backbone=F5-TTS [1], Branches=22026.06 | 1.46 | 0.6768 | |
| joint residual reweighting (Ours)Backbone=F5-TTS [1], Branches=42026.06 | 1.46 | 0.6875 | |
| Qwen3-TTS-25Hz-1.7B-BaseToken rate=25 Hz2026.06 | 1.49 | — | |
| LongCat-AudioDiT-3.5BNumber of Parameters=3.5B2026.03 | 1.5 | 78.6 | |
| CosyVoice3.5Model Architecture Type=AR/Hybrid2026.03 | 1.57 | 73.8 | |
| Ming-Flash-Omni-previewToken rate=12.5→3.1 Hz2026.06 | 1.59 | 68 | |
| ZipVoiceModel Architecture Type=NAR2026.03 | 1.64 | 66.8 | |
| Qwen3-TTS-25Hz-0.6B-BaseToken rate=25 Hz2026.06 | 1.64 | — | |
| DiTARModel Architecture Type=AR/Hybrid2026.03 | 1.69 | 73.5 | |
| Seed-DiTModel Architecture Type=NAR2026.03 | 1.73 | 79 | |
| LongCat-AudioDiT-1BNumber of Parameters=1B2026.03 | 1.78 | 76.2 | |
| Selective CFG†Backbone=F5-TTS [1], Branches=22026.06 | 1.8 | 0.69 | |
| F5 TTSModel Architecture Type=NAR2026.03 | 1.83 | 64.7 | |
| VoxCPMModel Architecture Type=AR/Hybrid2026.03 | 1.85 | 72.9 | |
| MOSS-TTSModel Architecture Type=AR/Hybrid2026.03 | 1.85 | 73.4 | |
| Ming-UniAudio-16B-A3BToken rate=50→10 Hz2026.06 | 1.85 | 58 | |
| F3-Tokenizer-LLM (4B)Token rate=25→12.5 Hz2026.06 | 1.88 | 68 | |
| MiniMax-SpeechModel Architecture Type=AR/Hybrid2026.03 | 1.9 | 73.8 | |
| joint residual reweighting (Ours)Backbone=CosyVoice2 [8], Branches=42026.06 | 1.94 | 0.6706 | |
| SparkTTSModel Architecture Type=AR/Hybrid2026.03 | 1.98 | 58.4 | |
| CFG (strength=1.0)Backbone=CosyVoice2 [8], Branches=22026.06 | 1.98 | 0.662 | |
| Ming-omni-tts-16.8B-A3BToken rate=12.5→3.1 Hz2026.06 | 2.02 | 62 | |
| CFG (strength=0.7)Backbone=CosyVoice2 [8], Branches=22026.06 | 2.05 | 0.6586 | |
| GT2026.03 | 2.14 | 73.4 | |
| FireRedTTS-1SModel Architecture Type=AR/Hybrid2026.03 | 2.17 | 66 | |
| E2 TTSModel Architecture Type=NAR2026.03 | 2.19 | 71 | |
| Ming-omni-tts-0.5BToken rate=12.5→3.1 Hz2026.06 | 2.19 | 61 | |
| CosyVoice3-1.5BModel Architecture Type=AR/Hybrid, Number of Parameters=1.5B2026.03 | 2.21 | 72 | |
| CosyVoice 3-1.5BToken rate=25 Hz2026.06 | 2.21 | 72 | |
| IndexTTS2Model Architecture Type=AR/Hybrid2026.03 | 2.23 | 70.6 | |
| Seed-ICLModel Architecture Type=AR/Hybrid2026.03 | 2.25 | 76.2 | |
| CosyVoice2Model Architecture Type=AR/Hybrid2026.03 | 2.57 | 65.2 | |
| Selective CFG†Backbone=CosyVoice2 [8], Branches=22026.06 | 2.6 | 0.666 | |
| MaskGCTModel Architecture Type=NAR2026.03 | 2.62 | 71.4 | |
| Qwen2.5-OmniModel Architecture Type=AR/Hybrid2026.03 | 2.72 | 63.2 | |
| VibeVoice-1.5BToken rate=7.5 Hz2026.06 | 3.04 | 68.9 | |
| CosyVoiceModel Architecture Type=AR/Hybrid2026.03 | 4.29 | 60.9 |