Automatic Speech Recognition on OOOK-Eval
57.1WERSDN W-Medium
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.7), Hrs=23.762026.01 | 57.1 | 20.6 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.9), Hrs=17.352026.01 | 57.2 | 20.9 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.7)+TTS, Hrs=28.372026.01 | 57.9 | 21.3 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.9), Hrs=13.422026.01 | 58.2 | 20.9 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.9)+TTS, Hrs=18.032026.01 | 59 | 21.1 | |
| SDN W-MediumEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.7), Hrs=19.832026.01 | 61 | 23.7 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.7)+TTS, Hrs=24.442026.01 | 61.8 | 24.1 | |
| SDN-Teacher W-MediumEvaluation Protocol=Self-training, Train Data=SDN-clean, Hrs=3.932026.01 | 62.5 | 24.9 | |
| SDN W-Large-v2Evaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 62.8 | 27.1 | |
| SDN W-MediumEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.9)+TTS, Hrs=21.962026.01 | 63.3 | 25.5 | |
| SDN W-MediumEvaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 64.1 | 26.7 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.7), Hrs=15.22026.01 | 64.6 | 25.5 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.7)+TTS, Hrs=19.812026.01 | 65.5 | 26.2 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.9)+TTS, Hrs=9.412026.01 | 65.6 | 25.9 | |
| SDN-Teacher W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean, Hrs=3.932026.01 | 67.3 | 26.3 | |
| SDN W-SmallEvaluation Protocol=TTS Data-Augmentation, Train Data=SDN-clean+TTS, Hrs=8.542026.01 | 67.4 | 27.1 | |
| SDN W-SmallEvaluation Protocol=Full Fine-tuning, Train Data=MSA+SDN, Hrs=7.252026.01 | 67.7 | 27.7 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.9), Hrs=4.802026.01 | 68.1 | 25.1 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=SDN-clean+Pseudo(con=0.9)+TTS, Hrs=13.342026.01 | 70.3 | 28.1 | |
| SDN W-SmallEvaluation Protocol=Self-training + Data-Augmentation, Train Data=Pseudo(con=0.7)+TTS, Hrs=15.882026.01 | 70.5 | 28.7 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=SDN-clean+Pseudo(con=0.9), Hrs=8.732026.01 | 71 | 30.5 | |
| SDN W-MediumEvaluation Protocol=TTS Data-Augmentation, Train Data=TTS, Hrs=4.612026.01 | 71.6 | 36.3 | |
| SDN W-SmallEvaluation Protocol=Self-training, Train Data=Pseudo(con=0.7), Hrs=11.272026.01 | 73.2 | 29.2 | |
| ARBML W-Medium-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 73.8 | 36.5 | |
| ARBML W-Large-v2-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 75.5 | 37.9 | |
| OpenAI W-Large-V2Evaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 78.8 | 47.7 | |
| ARBML W-Small-ArEvaluation Protocol=Zero-shot, Train Data=MGB2, Hrs=1.2k2026.01 | 83.5 | 43 | |
| OpenAI W-MediumEvaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 84.3 | 50.3 | |
| SDN W-MediumEvaluation Protocol=TTS Data-Augmentation, Train Data=SDN-clean+TTS, Hrs=8.542026.01 | 99.5 | 74.7 | |
| OpenAI W-SmallEvaluation Protocol=Zero-shot, Train Data=Multilingual, Hrs=680k2026.01 | 109 | 73 | |
| ARBML W-Small-CV-ArEvaluation Protocol=Zero-shot, Train Data=CV 11, Hrs=~1002026.01 | 123 | 164 | |
| SDN W-SmallEvaluation Protocol=TTS Data-Augmentation, Train Data=TTS, Hrs=4.612026.01 | 150 | 118 |