Speaker Fine-tuning on LibriHeavy
3.56Data MOSBase
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaseSpeaker ID=1259, Dataset Len. used (hours)=13.652, Energy Spread=-31.18 ± 8.25, Fine-tuning Strategy=Base2026.03 | 3.56 | 3.665 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=1259, Dataset Len. used (hours)=13.652, Energy Spread=-31.18 ± 8.25, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.56 | 3.664 | 0.001 | |
| LM-Backbone LoRA for TTSSpeaker ID=1259, Dataset Len. used (hours)=13.652, Energy Spread=-31.18 ± 8.25, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.56 | 3.614 | — | |
| BaseSpeaker ID=1401, Dataset Len. used (hours)=17.590, Energy Spread=-32.11 ± 11.89, Fine-tuning Strategy=Base2026.03 | 3.44 | 3.659 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=1401, Dataset Len. used (hours)=17.590, Energy Spread=-32.11 ± 11.89, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.44 | 3.385 | 0.274 | |
| LM-Backbone LoRA for TTSSpeaker ID=1401, Dataset Len. used (hours)=17.590, Energy Spread=-32.11 ± 11.89, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.44 | 3.435 | — | |
| BaseSpeaker ID=1212, Dataset Len. used (hours)=18.492, Energy Spread=-28.41 ± 9.91, Fine-tuning Strategy=Base2026.03 | 3.42 | 3.647 | — | |
| LM-Backbone LoRA for TTSSpeaker ID=1212, Dataset Len. used (hours)=18.492, Energy Spread=-28.41 ± 9.91, Fine-tuning Strategy=LoRA, Training Steps=10002026.03 | 3.42 | 3.233 | 0.414 | |
| LM-Backbone LoRA for TTSSpeaker ID=1212, Dataset Len. used (hours)=18.492, Energy Spread=-28.41 ± 9.91, Fine-tuning Strategy=LoRA, Epochs=52026.03 | 3.42 | 3.35 | — |