Text-to-Speech on LibriSpeech clean PC (test)
1.98WER (%)ARCHI-TTS
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ARCHI-TTS#Param.=289M, #Data=100K Multi., RTF=0.212026.02 | 1.98 | — | — | 0.7 | — | — | |
| VAE Resynthesized2026.02 | 2.19 | — | — | 0.67 | — | — | |
| Ground TruthSubset=1127 samples 2 hrs2024.10 | 2.23 | 0.69 | — | — | — | — | |
| Ground Truth#Data=1127 samples 2 hrs2026.02 | 2.23 | — | — | 0.69 | — | — | |
| Vocoder Resynthesized2024.10 | 2.32 | 0.66 | — | — | — | — | |
| Vocos Resynthesized2026.02 | 2.32 | — | — | 0.66 | — | — | |
| DiTAR#Param.=~600M, #Data=100K Multi.2026.02 | 2.39 | — | — | 0.67 | — | — | |
| F5-TTS#Param.=336M, #Data=100K Multi., NFE=322024.10 | 2.42 | 0.66 | 0.31 | — | — | — | |
| F5-TTS#Param.=336M, #Data=100K Multi., RTF=0.312026.02 | 2.42 | — | — | 0.66 | — | — | |
| F5-TTS#Param.=336M, #Data=100K Multi., NFE=162024.10 | 2.53 | 0.66 | 0.15 | — | — | — | |
| FireRedTTS#Param.=~580M, #Data=248K Multi.2024.10 | 2.69 | 0.47 | 0.84 | — | — | — | |
| FireRedTTS#Param.=~580M, #Data=248K Multi., RTF=0.842026.02 | 2.69 | — | — | 0.47 | — | — | |
| MaskGCT#Param.=~1.1B, #Data=100K Multi.2026.02 | 2.72 | — | — | 0.69 | — | — | |
| E2 TTS#Param.=333M, #Data=100K Multi., NFE=322024.10 | 2.95 | 0.69 | 0.68 | — | — | — | |
| E2 TTS#Param.=333M, #Data=100K Multi., RTF=0.682026.02 | 2.95 | — | — | 0.69 | — | — | |
| CosyVoice#Param.=~300M, #Data=170K Multi.2024.10 | 3.59 | 0.66 | 0.92 | — | — | — | |
| CosyVoice#Param.=~300M, #Data=170K Multi., RTF=0.922026.02 | 3.59 | — | — | 0.66 | — | — | |
| BigVGANParams (M)=112.4, Batch size=16, Audio length=1 second2025.12 | — | — | — | — | 0.214 | 69.8 | |
| BigVGAN-v2Params (M)=112.4, Batch size=16, Audio length=1 second2025.12 | — | — | — | — | 0.214 | 69.8 | |
| BigVGAN-v2*Params (M)=112.4, Batch size=16, Audio length=1 second, CUDA kernel usage=specialized CUDA kernel2025.12 | — | — | — | — | — | 121.9 | |
| Flow2GANParams (M)=78.9, Batch size=16, Audio length=1 second, Inference steps=12025.12 | — | — | — | — | 4.85 | 851.67 | |
| Flow2GANParams (M)=78.9, Batch size=16, Audio length=1 second, Inference steps=22025.12 | — | — | — | — | 2.46 | 449.26 | |
| Flow2GANParams (M)=78.9, Batch size=16, Audio length=1 second, Inference steps=42025.12 | — | — | — | — | 1.35 | 228.48 | |
| PeriodWave-TurboParams (M)=70.24, Batch size=16, Audio length=1 second, Inference steps=42025.12 | — | — | — | — | 0.12 | 43.7 | |
| RFWaveParams (M)=18.1, Batch size=16, Audio length=1 second, Inference steps=102025.12 | — | — | — | — | 0.37 | 158.8 | |
| VocosParams (M)=13.5, Batch size=16, Audio length=1 second2025.12 | — | — | — | — | 387.57 | 6,440.8 | |
| WaveFMParams (M)=19.5, Batch size=16, Audio length=1 second, Inference steps=12025.12 | — | — | — | — | 0.64 | 226.31 |