In-context Text-to-Speech on Accent internal subset
0.659Sim-oAUDIOBOX SPEECH
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AUDIOBOX SPEECHTraining data=100K hours2023.12 | 0.659 | 0.9 | |
| VoiceboxTraining data=60K hours2023.12 | 0.487 | 2.1 | |
| YourTTSTraining data=600 hours2023.12 | 0.366 | 4 |