ResearchBenchmarksIn-context Text-to-Speech on Librispeech clean (test)Follow2Word Error Rate (WER)UniAudio1.8083.1044.45.696Dec 25, 2023Evaluation ResultsMethodMethodLinksWord Error Rate (WER)Sim-rSim-oUniAudioTraining data=100K hoursTraining data=100K hours2023.1220.71—NS2Training data=44K hoursTraining data=44K hours2023.122.30.62—VoiceboxTraining data=60K hoursTraining data=60K hours2023.122.6—0.696AUDIOBOX SPEECHTraining data=100K hoursTraining data=100K hours2023.123.20.7450.734VALL-ETraining data=60K hoursTraining data=60K hours2023.125.90.58—YourTTSTraining data=600 hoursTraining data=600 hours2023.126.8—0.435