Text-to-Speech on Seed-zh (test)
0.78CERE2E-TTS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 32026.06 | 0.78 | — | 78.1 | |
| Fun-CosyVoice3-0.5B-2512_RLOpen-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 0.81 | 77.4 | — | |
| MiniMax-SpeechOpen-Source=No, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 0.83 | 78.3 | — | |
| GPA-3BOpen-Source=Yes, Model Size=3B, Method Architecture=One-Stage AR2026.01 | 0.84 | 73 | — | |
| OmniVoicearchitecture=Non-autoregressive, zero-shot=true2026.06 | 0.84 | — | 77.7 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 22026.06 | 0.86 | — | 77.5 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Ablation=w/o E2E-training2026.06 | 0.87 | — | 76 | |
| GLM-TTS RLOpen-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 0.89 | 76.4 | — | |
| VoxCPMOpen-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 0.93 | 77.2 | — | |
| GPA-0.3BOpen-Source=Yes, Model Size=0.3B, Method Architecture=One-Stage AR2026.01 | 0.95 | 65.9 | — | |
| JoyVoicearchitecture=Autoregressive, zero-shot=true2026.06 | 0.97 | — | 78.6 | |
| Index-TTS2Open-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.03 | 76.5 | — | |
| GLM-TTSOpen-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.03 | 76.1 | — | |
| Seed-TTSOpen-Source=No, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 1.12 | 79.6 | — | |
| Seed-TTSarchitecture=Autoregressive, zero-shot=true2026.06 | 1.12 | — | 79.6 | |
| CosyVoice3architecture=Autoregressive, zero-shot=true, Parameters=1.5B2026.06 | 1.12 | — | 78.1 | |
| FireRedTTS2Open-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.14 | 73.2 | — | |
| VibeVoice-1.5BOpen-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.16 | 74.4 | — | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 12026.06 | 1.16 | — | 77.5 | |
| Qwen3-TTSarchitecture=Autoregressive, zero-shot=true, Parameters=0.6B2026.06 | 1.18 | — | — | |
| Spark TTSOpen-Source=Yes, Model Size=0.5B, Method Architecture=One-Stage AR2026.01 | 1.2 | 66 | — | |
| Spark TTSarchitecture=Autoregressive, zero-shot=true2026.06 | 1.2 | — | 67.2 | |
| Fun-CosyVoice3-0.5B-2512Open-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.21 | 78 | — | |
| HumanOpen-Source=-, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 1.26 | 75.5 | — | |
| Humanzero-shot=true2026.06 | 1.26 | — | 75.5 | |
| F5R-TTSarchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.37 | — | 75.4 | |
| ZipVoicearchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.4 | — | 75.1 | |
| CosyVoice2Open-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.45 | 75.7 | — | |
| HiggsAudio-v2Open-Source=Yes, Model Size=3B, Method Architecture=Multi-Stage or NAR2026.01 | 1.5 | 74 | — | |
| F5-TTSOpen-Source=Yes, Model Size=0.3B, Method Architecture=Multi-Stage or NAR2026.01 | 1.52 | 74.1 | — | |
| F5-TTSarchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.56 | — | 74.1 | |
| MaskGCTarchitecture=Non-autoregressive, zero-shot=true2026.06 | 2.27 | — | 77.4 |