Text-to-Speech on LibriSpeech PC clean (test)
1.3WEROmniVoice
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| OmniVoiceParams.=0.8B, Training Data (hours)=581k Multi.2026.04 | 1.3 | 0.729 | 4.28 | — | — | — | — | |
| OmniVoiceZero-shot=true, #Params=0.8B2026.05 | 1.3 | 0.729 | 4.28 | — | — | — | — | |
| OmniVoice-EmiliaParams.=0.8B, Training Data (hours)=100k Emilia2026.04 | 1.57 | 0.697 | 4.23 | — | — | — | — | |
| OmniVoice-EmiliaZero-shot=true, #Params=0.8B2026.05 | 1.57 | 0.697 | 4.23 | — | — | — | — | |
| CosyVoice3Params.=1.1B, Training Data (hours)=1000k Multi.2026.04 | 1.59 | 0.694 | 4.28 | — | — | — | — | |
| CosyVoice3Zero-shot=true, #Params=1.1B2026.05 | 1.59 | 0.694 | 4.28 | — | — | — | — | |
| Qwen3-TTSParams.=1.1B, Training Data (hours)=5000k Multi.2026.04 | 1.6 | 0.704 | 4.41 | — | — | — | — | |
| Qwen3-TTSZero-shot=true, #Params=1.1B2026.05 | 1.6 | 0.704 | 4.41 | — | — | — | — | |
| Kyutai-TTS#Data(h)=88k EN, #Params=750M2026.03 | 1.63 | — | 4.04 | 0.66 | — | — | — | |
| ZipVoiceParams.=0.1B, Training Data (hours)=100k Emilia2026.04 | 1.64 | 0.668 | 3.98 | — | — | — | — | |
| ZipVoiceZero-shot=true, #Params=0.1B2026.05 | 1.64 | 0.668 | 3.98 | — | — | — | — | |
| Chatterbox-FlashZero-shot=true, Decoding method=PMI (α = 0), #Params=0.5B, Steps=82026.05 | 1.67 | 0.717 | 4.29 | — | — | — | — | |
| Chatterbox-FlashZero-shot=true, Decoding method=PMI + ED (α = 0.5), #Params=0.5B, Steps=6.42026.05 | 1.67 | 0.713 | 4.28 | — | — | — | — | |
| Chatterbox-FlashZero-shot=true, Decoding method=TS schedule, #Params=0.5B, Steps=82026.05 | 1.69 | 0.714 | 4.29 | — | — | — | — | |
| VoxCPMParams.=0.7B, Training Data (hours)=1800k Multi.2026.04 | 1.74 | 0.717 | 4.18 | — | — | — | — | |
| VoxCPMZero-shot=true, #Params=0.7B2026.05 | 1.74 | 0.717 | 4.18 | — | — | — | — | |
| F5-TTS-Base + SARAinference_mode=Zero-shot, #Param.=336M, Sample Rate=24k, Frame/s=502026.06 | 1.74 | 0.655 | — | — | 0 | 3.9 | — | |
| F5-TTS-Small + SARAinference_mode=Zero-shot, #Param.=159M, Sample Rate=24k, Frame/s=502026.06 | 1.79 | 0.63 | — | — | -0.03 | 3.89 | — | |
| Ground-truth2026.04 | 1.87 | 0.69 | 4.1 | — | — | — | — | |
| Ground-truthZero-shot=true2026.05 | 1.87 | 0.69 | 4.1 | — | — | — | — | |
| CLEAR#Params=686M, Data (hr)=50k2026.01 | 1.88 | 0.59 | 4.22 | — | — | — | — | |
| F5-TTSParams.=0.4B, Training Data (hours)=100K Emilia2026.04 | 1.89 | 0.655 | 3.89 | — | — | — | — | |
| F5-TTSZero-shot=true, #Params=0.4B2026.05 | 1.89 | 0.655 | 3.89 | — | — | — | — | |
| CosyVoice2#Data(h)=167k Multi., #Params=618M2026.03 | 1.93 | — | 4.38 | 0.655 | — | — | — | |
| Human#Data(h)=-, #Params=-2026.03 | 1.95 | — | 4.1 | 0.695 | — | — | — | |
| F5-TTS-Small + Semantic-VAEinference_mode=Zero-shot, #Param.=159M, Sample Rate=16k, Frame/s=402026.06 | 1.95 | 0.64 | — | — | — | — | — | |
| ChatterboxZero-shot=true, #Params=0.5B2026.05 | 1.99 | 0.707 | 4.29 | — | — | — | — | |
| F5-TTS#Data(h)=100k Multi., #Params=336M2026.03 | 2.05 | — | 3.88 | 0.653 | — | — | — | |
| F5-TTS + Semantic-VAETraining Setting=Low-resource, # Param.=159M, Data=0.6kh2025.09 | 2.1 | 0.64 | — | — | — | — | 4.17 | |
| Spark-TTS#Data(h)=102k Multi., #Params=507M2026.03 | 2.11 | — | 4.35 | 0.578 | — | — | — | |
| VoXtream2#Data(h)=40k EN, #Params=462M2026.03 | 2.12 | — | 4.24 | 0.638 | — | — | — | |
| VoiceStar#Data(h)=65k EN, #Params=840M2026.03 | 2.14 | — | 4.25 | 0.603 | — | — | — | |
| VoXtream2-B#Data(h)=40k EN, #Params=462M2026.03 | 2.14 | — | 4.02 | 0.658 | — | — | — | |
| GTinference_mode=Zero-shot2026.06 | 2.23 | 0.69 | — | — | 0.12 | 3.92 | — | |
| F5-TTS-Smallinference_mode=Zero-shot, #Param.=159M, Sample Rate=24k, Frame/s=93.752026.06 | 2.23 | 0.6 | — | — | -0.1 | 3.85 | — | |
| Ground Truth# Param.=-, Data=-2025.09 | 2.23 | 0.69 | — | — | — | — | 4.2 | |
| F5-TTSTraining Setting=Low-resource, # Param.=159M, Data=0.6kh2025.09 | 2.23 | 0.6 | — | — | — | — | 3.99 | |
| MaskGCTParams.=2.2B, Training Data (hours)=100K Emilia2026.04 | 2.26 | 0.691 | 3.91 | — | — | — | — | |
| MaskGCTZero-shot=true, #Params=2.2B2026.05 | 2.26 | 0.691 | 3.91 | — | — | — | — | |
| Vocoder Resynthesizedinference_mode=Zero-shot, Sample Rate=24k2026.06 | 2.32 | 0.66 | — | — | 0.1 | 3.91 | — | |
| SylFlow#Params=72M, Data (hr)=0.6k + 47k2026.01 | 2.35 | 0.36 | 4.33 | — | — | — | — | |
| IndexTTS2Params.=1.7B, Training Data (hours)=55k Multi.2026.04 | 2.35 | 0.7 | 4.06 | — | — | — | — | |
| IndexTTS2Zero-shot=true, #Params=1.7B2026.05 | 2.35 | 0.7 | 4.06 | — | — | — | — | |
| DiTAR#Params=600M, Data (hr)=100k2026.01 | 2.39 | 0.67 | 4.22 | — | — | — | — | |
| E2 TTS + Semantic-VAETraining Setting=Low-resource, # Param.=157M, Data=0.6kh2025.09 | 2.41 | 0.62 | — | — | — | — | 3.88 | |
| F5-TTS#Params=300M, Data (hr)=100k2026.01 | 2.42 | 0.66 | 3.88 | — | — | — | — | |
| F5-TTSinference_mode=Zero-shot, #Param.=336M, Sample Rate=24k2026.06 | 2.42 | 0.66 | — | — | -0.06 | 3.99 | — | |
| F5-TTSTraining Setting=High-resource, # Param.=336M, Data=100kh2025.09 | 2.42 | 0.66 | — | — | — | — | — | |
| GT#Params=-, Data (hr)=-2026.01 | 2.47 | 0.69 | 4.09 | — | — | — | — | |
| CosyVoice 2#Params=500M, Data (hr)=170k2026.01 | 2.47 | 0.65 | 4.35 | — | — | — | — | |
| MaskGCT#Data(h)=100k Multi., #Params=1048M2026.03 | 2.58 | — | 3.92 | 0.691 | — | — | — | |
| F5-TTS + Vanilla VAETraining Setting=Low-resource, # Param.=159M, Data=0.6kh2025.09 | 2.65 | 0.6 | — | — | — | — | 4.13 | |
| FireRedTTS#Params=580M, Data (hr)=248k2026.01 | 2.69 | 0.47 | — | — | — | — | — | |
| FireRedTTSTraining Setting=High-resource, # Param.=580M, Data=248kh2025.09 | 2.69 | 0.47 | — | — | — | — | — | |
| MaskGCT#Params=1048M, Data (hr)=100k2026.01 | 2.72 | 0.69 | 3.9 | — | — | — | — | |
| E2 TTSinference_mode=Zero-shot, #Param.=333M, Sample Rate=24k2026.06 | 2.95 | 0.69 | — | — | -0.08 | 3.98 | — | |
| E2 TTSTraining Setting=High-resource, # Param.=333M, Data=100kh2025.09 | 2.95 | 0.69 | — | — | — | — | — | |
| SylFlow#Params=72M, Data (hr)=0.6k2026.01 | 3.1 | 0.31 | 4.27 | — | — | — | — | |
| E2 TTSTraining Setting=Low-resource, # Param.=157M, Data=0.6kh2025.09 | 3.51 | 0.61 | — | — | — | — | 3.68 | |
| CosyVoice#Params=300M, Data (hr)=170k2026.01 | 3.59 | 0.66 | — | — | — | — | — | |
| Cosyvoiceinference_mode=Zero-shot, #Param.=300M, Sample Rate=24k2026.06 | 3.59 | 0.66 | — | — | -0.14 | 3.95 | — | |
| CosyVoiceTraining Setting=High-resource, # Param.=300M, Data=170kh2025.09 | 3.59 | 0.66 | — | — | — | — | — | |
| Mel#Params=109M, Data (hr)=0.6k2026.01 | 5.73 | 0.18 | 3.28 | — | — | — | — | |
| USLMTraining Setting=Low-resource, # Param.=361M, Data=0.6kh2025.09 | 6.11 | 0.43 | — | — | — | — | — | |
| Mimi#Params=74M, Data (hr)=0.6k2026.01 | 10.36 | 0.3 | 2.38 | — | — | — | — | |
| Chatterbox-FlashZero-shot=true, Decoding method=Fast-dLLM v2 decoding, #Params=0.5B, Steps=102026.05 | 15.36 | 0.656 | 4.14 | — | — | — | — | |
| SparkTTS#Params=500M, Data (hr)=100k2026.01 | — | — | 4.35 | — | — | — | — |