Automatic Speech Recognition on H-O out-of-domain Sudanese dataset (holdout)
51.6WERSDN W-Medium
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.7)+TTS, Hrs=28.372026.01 | 51.6 | 26.5 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.9), Hrs=17.352026.01 | 52.1 | 26.6 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.9)+TTS, Hrs=18.032026.01 | 52.7 | 26.7 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.9)+TTS, Hrs=21.962026.01 | 53.2 | 28 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.7), Hrs=19.832026.01 | 53.3 | 27.2 | |
| SDN-Teacher W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean, Hrs=3.932026.01 | 54 | 28.3 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.7), Hrs=23.762026.01 | 54.1 | 28.2 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.7)+TTS, Hrs=24.442026.01 | 54.6 | 28.4 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.9), Hrs=13.422026.01 | 56.5 | 29.6 | |
| SDN W-MediumEvaluation Protocol=TTS Data-Augmentation, Train Data=SDN-clean+TTS, Hrs=8.542026.01 | 57 | 31.2 | |
| SDN W-MediumEvaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 57.5 | 30.9 | |
| SDN W-Large-v2Evaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 59.7 | 34.8 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.7), Hrs=15.22026.01 | 60.9 | 31.3 | |
| SDN W-SmallEvaluation Protocol=TTS Data-Augmentation, Train Data=SDN-clean+TTS, Hrs=8.542026.01 | 61.4 | 32.1 | |
| SDN-Teacher W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean, Hrs=3.932026.01 | 61.8 | 32.2 | |
| SDN W-SmallEvaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 63.4 | 32.6 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.9), Hrs=8.732026.01 | 63.5 | 33.1 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.9)+TTS, Hrs=9.412026.01 | 63.9 | 32.3 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.7), Hrs=11.272026.01 | 64 | 32.8 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.7)+TTS, Hrs=19.812026.01 | 64.4 | 33.6 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.9)+TTS, Hrs=13.342026.01 | 64.5 | 35 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.7)+TTS, Hrs=15.882026.01 | 65.1 | 33 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.9), Hrs=4.802026.01 | 68.8 | 36.2 | |
| SDN W-MediumEvaluation Protocol=TTS Data-Augmentation, Train Data=TTS, Hrs=4.612026.01 | 79.9 | 69.4 | |
| OpenAI W-Large-V2Evaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 88.5 | 62.6 | |
| OpenAI W-MediumEvaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 96.8 | 65.5 | |
| SDN W-SmallEvaluation Protocol=TTS Data-Augmentation, Train Data=TTS, Hrs=4.612026.01 | 101 | 69.4 | |
| OpenAI W-SmallEvaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 118 | 87.8 | |
| ARBML W-Medium-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 140 | 99.6 | |
| ARBML W-Large-v2-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 146 | 109 | |
| ARBML W-Small-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 149 | 109 | |
| ARBML W-Small-CV-ArEvaluation Protocol=Zero-shot, Train Data=CV 11, Hrs=~1002026.01 | 191 | 229 |