Text-to-Speech on LibriSpeech clean (test)
1.5WERLlasa-8B
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Llasa-8BCategory=TTS-Experts2026.03 | 1.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NaturalSpeech 3zero-shot=true, #Param.=500M2026.05 | 1.81 | — | 4.3 | — | — | — | — | — | — | — | — | — | — | 0.67 | — | — | — | — | — | — | |
| FC-TTSzero-shot=true, #Param.=204M2026.05 | 1.88 | — | 4.22 | — | — | — | — | — | — | — | — | — | — | 0.6 | — | — | — | — | — | — | |
| MELDLslow=true, Freq=62.5, Vocoder=HiFi-GAN2026.05 | 1.9 | 0.872 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MELDLslow=true, Freq=31.3, Vocoder=HiFi-GAN2026.05 | 1.9 | 0.855 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ground Truth2025.05 | 2 | — | 4.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ground TruthType=N/A, Data (hours)=N/A2025.09 | 2 | — | 4.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PURE CodecTraining Data=OWSM-v3.2 (150k hours)2025.11 | 2.05 | — | 3.64 | — | — | — | — | — | — | 2.17 | 2.62 | 3.21 | 4.41 | 0.71 | — | — | — | — | — | — | |
| PURE CodecTraining Data=URGENT (2k hours)2025.11 | 2.07 | — | 3.41 | — | — | — | — | — | — | 1.35 | 2.5 | 3.09 | 4.36 | 0.54 | — | — | — | — | — | — | |
| Ground-truthzero-shot=true2026.05 | 2.07 | — | 4.1 | — | — | — | — | — | — | — | — | — | — | 0.71 | — | — | — | — | — | — | |
| Ground TruthSteps=-, Params=-2026.02 | 2.1 | — | — | 0.69 | — | — | — | — | — | — | — | — | — | — | 4.49 | 4.46 | 3.84 | — | — | — | |
| Dynin-OmniCategory=Unified, Block size=128, Diffusion steps=5122026.03 | 2.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PURE CodecTraining Data=Commonvoice (16k hours)2025.11 | 2.14 | — | 3.65 | — | — | — | — | — | — | 2.7 | 2.7 | 3.18 | 4.39 | 0.76 | — | — | — | — | — | — | |
| HiFi-GANzero-shot=true2026.05 | 2.17 | — | 3.7 | — | — | — | — | — | — | — | — | — | — | 0.64 | — | — | — | — | — | — | |
| Ground truth2026.04 | 2.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Baseline DACTraining Data=OWSM-v3.2 (150k hours)2025.11 | 2.26 | — | 3.42 | — | — | — | — | — | — | 4.01 | 2.37 | 3.17 | 4.34 | 0.64 | — | — | — | — | — | — | |
| DAC recon.2026.04 | 2.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSzero-shot=true, #Param.=336M2026.05 | 2.42 | — | — | — | — | — | — | — | — | — | — | — | — | 0.66 | — | — | — | — | — | — | |
| MaskGCTCategory=TTS-Experts2026.03 | 2.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Original DACTraining Data=Not applicable2025.11 | 2.68 | — | 3.6 | — | — | — | — | — | — | 1.79 | 3.4 | 3.16 | 4.49 | 0.73 | — | — | — | — | — | — | |
| DiTTo-TTSzero-shot=true, #Param.=508M2026.05 | 2.69 | — | — | — | — | — | — | — | — | — | — | — | — | 0.6 | — | — | — | — | — | — | |
| BagpiperMode=Zero-shot2026.02 | 2.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ground TruthTraining Data=Not applicable2025.11 | 2.73 | — | 4.09 | — | — | — | — | — | — | — | — | 3.18 | — | — | — | — | — | — | — | — | |
| StepTTSSteps=10, Params=154M2026.02 | 2.8 | — | — | 0.66 | — | — | — | — | — | — | — | — | — | — | 4.43 | 4.39 | 4.42 | 0.303 | — | — | |
| CoD-LargeParams. (M)=503, Training Data=LibriTTS-clean + MLS-En-Clean, Hours=32972026.04 | 2.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CosyVoice3Mode=Fine-tuned2026.02 | 2.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CosyVoice2Steps=10, Params=150M2026.02 | 2.9 | — | — | 0.64 | — | — | — | — | — | — | — | — | — | — | 4.41 | 4.38 | 4.29 | 0.31 | — | — | |
| DSFlow (4-step student)Steps=4, Params=118M2026.02 | 2.9 | — | — | 0.68 | — | — | — | — | — | — | — | — | — | — | 4.41 | 4.35 | 4.32 | 0.03 | — | — | |
| Baseline DACTraining Data=Commonvoice (16k hours)2025.11 | 3 | — | 1.45 | — | — | — | — | — | — | -5.21 | 1.36 | 2.13 | 4.07 | 0.31 | — | — | — | — | — | — | |
| DSFlow (2-step student)Steps=2, Params=118M2026.02 | 3 | — | — | 0.68 | — | — | — | — | — | — | — | — | — | — | 4.38 | 4.35 | 4.31 | 0.018 | — | — | |
| Ground Truthcalculation_method=whisper-large-v32026.04 | 3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoD-BaseParams. (M)=263, Training Data=LibriTTS-clean, Hours=2452026.04 | 3.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSFlow (StepTTS Student)Steps=1, Params=118M2026.02 | 3.1 | — | — | 0.66 | — | — | — | — | — | — | — | — | — | — | 4.32 | 4.29 | 4.27 | 0.012 | — | — | |
| DSFlow (CosyVoice2 Student)Steps=1, Params=150M2026.02 | 3.1 | — | — | 0.63 | — | — | — | — | — | — | — | — | — | — | 4.23 | 4.21 | 4.18 | 0.018 | — | — | |
| NExT-OMNI∗Category=Unified, Support video generation=true2026.03 | 3.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSSteps=32, Params=200M2026.02 | 3.2 | — | — | 0.62 | — | — | — | — | — | — | — | — | — | — | 4.38 | 4.25 | 4.21 | 0.25 | — | — | |
| VITSSteps=1, Params=120M2026.02 | 3.2 | — | — | 0.56 | — | — | — | — | — | — | — | — | — | — | 4.05 | 4.08 | 3.49 | 0.015 | — | — | |
| CSLM-base2026.04 | 3.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| E2-TTSSteps=32, Params=150M2026.02 | 3.3 | — | — | 0.61 | — | — | — | — | — | — | — | — | — | — | 4.31 | 4.17 | 4.15 | 0.28 | — | — | |
| F5-TTSzero-shot=true, #Param.=205M, Re-trained on Libriheavy=true2026.05 | 3.3 | — | 4.03 | — | — | — | — | — | — | — | — | — | — | 0.67 | — | — | — | — | — | — | |
| IntMeanFlowSteps=1, Params=154M2026.02 | 3.4 | — | — | 0.63 | — | — | — | — | — | — | — | — | — | — | 4.1 | 3.96 | 4.23 | 0.018 | — | — | |
| DSFlow (F5-TTS Student)Steps=1, Params=118M2026.02 | 3.4 | — | — | 0.61 | — | — | — | — | — | — | — | — | — | — | 4.15 | 4.02 | 4.01 | 0.015 | — | — | |
| OpenOmniCategory=Perception-centric2026.03 | 3.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CosyVoicemodel_version=CosyVoice-300M-SFT2026.04 | 3.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSFlow (E2-TTS Student)Steps=1, Params=150M2026.02 | 3.5 | — | — | 0.58 | — | — | — | — | — | — | — | — | — | — | 4.11 | 4.03 | 3.95 | 0.02 | — | — | |
| Progressive DistillationSteps=1, Params=154M2026.02 | 3.6 | — | — | 0.55 | — | — | — | — | — | — | — | — | — | — | 3.92 | 3.68 | 4.18 | 0.015 | — | — | |
| EMOVA-7BCategory=Perception-centric2026.03 | 3.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NAR 2-stageParams. (M)=476, Training Data=LibriTTS-clean, Hours=2452026.04 | 3.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Baseline DACTraining Data=URGENT (2k hours)2025.11 | 3.67 | — | 1.31 | — | — | — | — | — | — | -6.79 | 1.32 | 1.97 | 4.12 | 0.38 | — | — | — | — | — | — | |
| MELDLslow=false, Freq=62.5, Vocoder=HiFi-GAN2026.05 | 3.7 | 0.862 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSLM-SFT2026.04 | 3.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroundtruthEvaluation Protocol=zero-shot2024.04 | 4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StyleTTS 2Training Data=LibriTTS-clean, Hours=2452026.04 | 4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mel-LMLslow=true, Freq=62.5, Vocoder=HiFi-GAN2026.05 | 4.2 | 0.825 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MELLELslow=true, Freq=62.5, Vocoder=HiFi-GAN2026.05 | 4.2 | 0.826 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Moshi2026.04 | 4.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Endpoint DistillationSteps=1, Params=154M2026.02 | 4.8 | — | — | 0.52 | — | — | — | — | — | — | — | — | — | — | 3.56 | 3.42 | 4.01 | 0.015 | — | — | |
| OZSpeechData (hours)=LT (500), Audio prompt length=1s, Zero-shot=true2025.05 | 5 | — | 3.17 | 0.3 | 0.33 | 0.62 | 27.7 | 0.49 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| OZSpeechData (hours)=LT (500), Audio prompt length=3s, Zero-shot=true2025.05 | 5 | — | 3.15 | 0.4 | 0.47 | 0.81 | 11.96 | 0.67 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| OZSpeechData (hours)=LT (500), Audio prompt length=5s, Zero-shot=true2025.05 | 5 | — | 3.15 | 0.39 | 0.48 | 0.83 | 12.05 | 0.67 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| OZSpeechType=(ii), Data (hours)=LT (500), Source=Official checkpoint2025.09 | 5 | — | 3.15 | 0.4 | — | 81 | 11.96 | 67 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| DiFlow-TTSType=(iv), Data (hours)=LT (470), NFEs=1282025.09 | 5 | — | 3.98 | 0.45 | — | 88 | 7.97 | 73 | 0.007 | — | — | — | — | — | — | — | — | — | — | — | |
| CLaM-TTSzero-shot=true, #Param.=584M2026.05 | 5.11 | — | — | — | — | — | — | — | — | — | — | — | — | 0.5 | — | — | — | — | — | — | |
| VALL-EParams. (M)=370, Training Data=LibriLight, Hours=60k2026.04 | 5.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KD-NARSISParams. (M)=249, Training Data=LibriTTS-clean, Hours=2452026.04 | 5.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-DPO-Iter3Evaluation Protocol=zero-shot2024.04 | 6 | 0.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-DPO-Iter2Evaluation Protocol=zero-shot2024.04 | 6.2 | 0.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-TTS-1.7BCategory=TTS-Experts, Reproduction=‡2026.03 | 6.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-DPO-Iter1Evaluation Protocol=zero-shot2024.04 | 6.7 | 0.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-Omni-7BCategory=Perception-centric, Reproduction=‡2026.03 | 7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-RLHF-PPOEvaluation Protocol=zero-shot2024.04 | 7.1 | 0.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YourTTSTraining Data=LibriTTS-clean+Pt+Fr, Hours=4742026.04 | 7.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-sftEvaluation Protocol=zero-shot2024.04 | 7.2 | 0.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-CoHEvaluation Protocol=zero-shot2024.04 | 7.3 | 0.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperCLOVAX-8B-OmniCategory=Unified, Reproduction=‡2026.03 | 7.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Continue SFTEvaluation Protocol=zero-shot2024.04 | 8 | 0.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechAlign-BoNEvaluation Protocol=zero-shot2024.04 | 8 | 0.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NaturalSpeech 2Data (hours)=LT (585), Audio prompt length=3s, Zero-shot=true2025.05 | 9 | — | 2.38 | 0.31 | 0.38 | 0.8 | 15.62 | 0.25 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| NaturalSpeech 2Data (hours)=LT (585), Audio prompt length=5s, Zero-shot=true2025.05 | 9 | — | 2.33 | 0.35 | 0.44 | 0.84 | 13.13 | 0.28 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| NaturalSpeech 2Type=(ii), Data (hours)=LT (585), Source=Unofficial checkpoint2025.09 | 9 | — | 2.38 | 0.31 | — | 80 | 15.62 | 25 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSType=(ii), Data (hours)=E (100K), Source=Official checkpoint2025.09 | 9 | — | 3.72 | 0.66 | — | 83 | 12.66 | 66 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| MaskGCTType=(iii), Data (hours)=E (100K), Source=Official checkpoint2025.09 | 9 | — | 3.83 | 0.67 | — | 77 | 14.33 | 75 | 0.007 | — | — | — | — | — | — | — | — | — | — | — | |
| NaturalSpeech 2Data (hours)=LT (585), Audio prompt length=1s, Zero-shot=true2025.05 | 12 | — | 2.12 | 0.2 | 0.21 | 0.69 | 26.48 | 0.39 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| VoiceCraftData (hours)=GS (9,000), Audio prompt length=1s, Zero-shot=true2025.05 | 16 | — | 3.45 | 0.31 | 0.24 | 0.61 | 31.57 | 0.52 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| VoiceCraftData (hours)=GS (9,000), Audio prompt length=3s, Zero-shot=true2025.05 | 18 | — | 3.55 | 0.51 | 0.45 | 0.78 | 17.22 | 0.44 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| VoiceCraftType=(i), Data (hours)=GS (9K), Source=Official checkpoint2025.09 | 18 | — | 3.55 | 0.51 | — | 78 | 17.22 | 44 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSData (hours)=E (95,000), Audio prompt length=1s, Zero-shot=true2025.05 | 19 | — | 3.73 | 0.32 | — | 0.61 | 29.93 | 0.5 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| VALL-EData (hours)=LT (500), Audio prompt length=3s, Zero-shot=true2025.05 | 19 | — | 3.68 | 0.4 | 0.48 | 0.75 | 21.66 | 0.36 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| VoiceCraftData (hours)=GS (9,000), Audio prompt length=5s, Zero-shot=true2025.05 | 19 | — | 3.58 | 0.56 | 0.51 | 0.81 | 14.48 | 0.46 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| VALL-EData (hours)=LT (500), Audio prompt length=5s, Zero-shot=true2025.05 | 19 | — | 3.72 | 0.46 | 0.55 | 0.79 | 18.2 | 0.41 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| VALL-EType=(i), Data (hours)=LT (500), Source=Reproduced2025.09 | 19 | — | 3.68 | 0.4 | — | 75 | 21.66 | 36 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| VALL-EData (hours)=LT (500), Audio prompt length=1s, Zero-shot=true2025.05 | 21 | — | 3.61 | 0.24 | 0.28 | 0.55 | 37.87 | 0.4 | 0.02 | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSData (hours)=E (95,000), Audio prompt length=3s, Zero-shot=true2025.05 | 24 | — | 3.76 | 0.53 | — | 0.8 | 13.78 | 0.67 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSType=(ii), Data (hours)=LT (500), Source=Reproduced2025.09 | 24 | — | 3.76 | 0.52 | — | 80 | 13.78 | 67 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| SpeechGPT2026.04 | 24.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AnyGPT2026.04 | 27.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F5-TTSData (hours)=E (95,000), Audio prompt length=5s, Zero-shot=true2025.05 | 32 | — | 3.72 | 0.58 | — | 0.83 | 11.2 | 0.68 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineIters=20k, Gen. Units=1.0×2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 14.1 | — | |
| CSM-1Bcodec=Mimi, decoding strategy=base2026.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 1.7 | |
| CSM-1B (Best-of-2 self-verification)codec=Mimi, decoding strategy=best-of-22026.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 0 |