Dysarthric Speech Naturalness Assessment on SAP (Speech Accessibility Project)
0.717MSEFine-Tuning (FT)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.717 | 0.717 | 0.657 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.8 | 0.709 | 0.713 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.819 | 0.701 | 0.69 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.823 | 0.678 | 0.675 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.847 | 0.644 | 0.587 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.88 | 0.692 | 0.69 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.909 | 0.691 | 0.68 | |
| Joint Training (JT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.93 | 0.661 | 0.668 | |
| IDT (In-Domain Training)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=–2026.06 | 0.941 | 0.57 | 0.503 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1 | 0.686 | 0.696 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.022 | 0.637 | 0.643 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.022 | 0.637 | 0.642 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1.027 | 0.606 | 0.613 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1.033 | 0.695 | 0.706 | |
| Joint Training (JT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.036 | 0.638 | 0.635 | |
| Joint Training (JT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1.05 | 0.614 | 0.634 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1.053 | 0.718 | 0.723 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.075 | 0.646 | 0.635 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.085 | 0.629 | 0.648 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Overall2026.06 | 1.106 | 0.589 | 0.617 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=–2026.06 | 1.119 | 0.574 | 0.607 | |
| Joint Training (JT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 1.121 | 0.586 | 0.59 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=–2026.06 | 1.127 | 0.581 | 0.591 | |
| IDT (In-Domain Training)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=–2026.06 | 1.169 | 0.546 | 0.521 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=–2026.06 | 1.354 | 0.469 | 0.481 |