ResearchBenchmarksText-to-Speech Synthesis on 10-second speech segmentsFollow1.4Inference Time (s)MELLE-R41.16322.76164.365.9584Jul 11, 2024Evaluation ResultsMethodMethodLinksInference Time (s)MELLE-R4AR Steps=156, Reductio...AR Steps=156, Reduction factor=r=42024.071.4MELLE-R2AR Steps=312, Reductio...AR Steps=312, Reduction factor=r=22024.072.76VALL-E RAR Steps=375AR Steps=3752024.073.67CLaM-TTS2024.074.15MELLEAR Steps=625AR Steps=6252024.075.49VoiceBoxNFE=64NFE=642024.076.4VALL-EAR Steps=750AR Steps=7502024.077.32VALL-E 2AR Steps=750AR Steps=7502024.077.32