Speaker Fine-tuning on HiFiTTS
3.51Data MOSBase
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaseSpeaker ID=2, Dataset Len. used (hours)=3.907, Energy Spread=-29.34 ± 13.11, Fine-tuning Strategy=Base2026.03 | 3.51 | 3.717 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=2, Dataset Len. used (hours)=3.907, Energy Spread=-29.34 ± 13.11, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.51 | 4.141 | 0.424 | |
| LM-Backbone LoRA for TTSSpeaker ID=2, Dataset Len. used (hours)=3.907, Energy Spread=-29.34 ± 13.11, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.51 | 4.106 | — | |
| BaseSpeaker ID=1, Dataset Len. used (hours)=3.523, Energy Spread=-29.73 ± 12.93, Fine-tuning Strategy=Base2026.03 | 3.48 | 3.832 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=1, Dataset Len. used (hours)=3.523, Energy Spread=-29.73 ± 12.93, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.48 | 3.861 | 0.029 | |
| LM-Backbone LoRA for TTSSpeaker ID=1, Dataset Len. used (hours)=3.523, Energy Spread=-29.73 ± 12.93, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.48 | 3.813 | — | |
| BaseSpeaker ID=11614, Dataset Len. used (hours)=3.860, Energy Spread=-32.20 ± 13.34, Fine-tuning Strategy=Base2026.03 | 3.3 | 3.68 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=11614, Dataset Len. used (hours)=3.860, Energy Spread=-32.20 ± 13.34, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.3 | 3.818 | 0.138 | |
| LM-Backbone LoRA for TTSSpeaker ID=11614, Dataset Len. used (hours)=3.860, Energy Spread=-32.20 ± 13.34, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.3 | 3.768 | — |