Dysarthric Speech Intelligibility Assessment on SAP
0.272MSEFine-Tuning (FT)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.272 | 0.751 | 0.427 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.303 | 0.648 | 0.464 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.308 | 0.534 | 0.285 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=–2026.06 | 0.348 | 0.628 | 0.482 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.351 | 0.612 | 0.393 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.379 | 0.451 | 0.295 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.379 | 0.608 | 0.464 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.387 | 0.572 | 0.401 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.408 | 0.59 | 0.446 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=–2026.06 | 0.421 | 0.523 | 0.368 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.431 | 0.596 | 0.356 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.433 | 0.602 | 0.475 | |
| Joint Training (JT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.451 | 0.551 | 0.391 | |
| IDT (In-Domain Training)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=–2026.06 | 0.461 | 0.54 | 0.406 | |
| IDT (In-Domain Training)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=–2026.06 | 0.475 | 0.485 | 0.404 | |
| Fine-Tuning (FT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.487 | 0.594 | 0.368 | |
| Joint Training (JT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.489 | 0.515 | 0.309 | |
| Fine-Tuning (FT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.495 | 0.566 | 0.443 | |
| Joint Training (JT)SSL Encoder=HuBERT Large, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.526 | 0.479 | 0.363 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.528 | 0.445 | 0.348 | |
| IDT (In-Domain Training)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=–2026.06 | 0.547 | 0.471 | 0.322 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.56 | 0.317 | 0.33 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large*, QualiSpeech Auxiliary Supervision=Naturalness2026.06 | 0.604 | 0.383 | 0.352 | |
| Joint Training (JT)SSL Encoder=HuBERT Base, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.612 | 0.387 | 0.317 | |
| Joint Training (JT)SSL Encoder=wav2vec 2.0 Large+, QualiSpeech Auxiliary Supervision=Overall2026.06 | 0.627 | 0.225 | 0.302 |