Text-to-Speech on Seed-en (test)
1.31WERGPA-3B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPA-3BOpen-Source=Yes, Model Size=3B, Method Architecture=One-Stage AR2026.01 | 1.31 | 71.7 | |
| GPA-0.3BOpen-Source=Yes, Model Size=0.3B, Method Architecture=One-Stage AR2026.01 | 1.51 | 56.5 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 32026.06 | 1.56 | 70.5 | |
| OmniVoicearchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.6 | 74.1 | |
| Qwen3-TTSarchitecture=Autoregressive, zero-shot=true, Parameters=0.6B2026.06 | 1.64 | — | |
| MiniMax-SpeechOpen-Source=No, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 1.65 | 69.2 | |
| Fun-CosyVoice3-0.5B-2512_RLOpen-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.68 | 69.5 | |
| JoyVoicearchitecture=Autoregressive, zero-shot=true2026.06 | 1.69 | 73.6 | |
| ZipVoicearchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.7 | 69.7 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 22026.06 | 1.72 | 69.6 | |
| F5-TTSarchitecture=Non-autoregressive, zero-shot=true2026.06 | 1.83 | 64.7 | |
| VoxCPMOpen-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.85 | 72.9 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Ablation=w/o E2E-training2026.06 | 1.89 | 68.2 | |
| FireRedTTS2Open-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 1.95 | 66.5 | |
| Spark TTSOpen-Source=Yes, Model Size=0.5B, Method Architecture=One-Stage AR2026.01 | 1.98 | 57.3 | |
| Spark TTSarchitecture=Autoregressive, zero-shot=true2026.06 | 1.98 | 58.4 | |
| F5-TTSOpen-Source=Yes, Model Size=0.3B, Method Architecture=Multi-Stage or NAR2026.01 | 2 | 64.7 | |
| VibeVoice-RealtimeOpen-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 2.05 | 63.3 | |
| E2E-TTSarchitecture=Autoregressive, zero-shot=true, Training Stage=Stage 12026.06 | 2.09 | 69 | |
| HumanOpen-Source=-, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 2.14 | 73.4 | |
| Humanzero-shot=true2026.06 | 2.14 | 73.4 | |
| CosyVoice3architecture=Autoregressive, zero-shot=true, Parameters=1.5B2026.06 | 2.21 | 72 | |
| Index-TTS2Open-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 2.23 | 70.6 | |
| Fun-CosyVoice3-0.5B-2512Open-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 2.24 | 71.8 | |
| Seed-TTSOpen-Source=No, Model Size=-, Method Architecture=Multi-Stage or NAR2026.01 | 2.25 | 76.2 | |
| Seed-TTSarchitecture=Autoregressive, zero-shot=true2026.06 | 2.25 | 76.2 | |
| HiggsAudio-v2Open-Source=Yes, Model Size=3B, Method Architecture=Multi-Stage or NAR2026.01 | 2.44 | 67.7 | |
| CosyVoice2Open-Source=Yes, Model Size=0.5B, Method Architecture=Multi-Stage or NAR2026.01 | 2.57 | 65.9 | |
| MaskGCTarchitecture=Non-autoregressive, zero-shot=true2026.06 | 2.62 | 71.4 | |
| VibeVoice-1.5BOpen-Source=Yes, Model Size=1.5B, Method Architecture=Multi-Stage or NAR2026.01 | 3.04 | 68.9 |