Speech Recognition on MuST-C (test)
6.54WER (Avg)Specialized
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SpecializedFT Data=N/A, Giga Dataset=false2024.12 | 6.54 | — | |
| w2v2-CTCLearning Paradigm=Supervised learning + pre-training, Decoding Method=4-gram language model2022.10 | 8.9 | 6.3 | |
| contr-cos-allFT Data=100%, Giga Dataset=true2024.12 | 9.31 | — | |
| contr-wasser-all + asrFT Data=100%, Giga Dataset=true2024.12 | 9.5 | — | |
| contr-cos-all + asrFT Data=100%, Giga Dataset=true2024.12 | 10.03 | — | |
| contr-cos-all + asrFT Data=100%, Giga Dataset=false2024.12 | 10.04 | — | |
| ASR pretrainFT Data=100%, Giga Dataset=false2024.12 | 10.28 | — | |
| contr-wasser-allFT Data=100%, Giga Dataset=false2024.12 | 10.35 | — | |
| contr-cos-allFT Data=10%, Giga Dataset=true2024.12 | 10.94 | — | |
| contr-cos-all + asrFT Data=10%, Giga Dataset=true2024.12 | 11.12 | — | |
| contr-wasser-all + asrFT Data=10%, Giga Dataset=false2024.12 | 11.23 | — | |
| ASR pretrainFT Data=100%, Giga Dataset=true2024.12 | 11.48 | — | |
| contr-cos-all + asrFT Data=10%, Giga Dataset=false2024.12 | 11.68 | — | |
| Qwen2-Audio-7bFT Data=N/A, Giga Dataset=false2024.12 | 12.03 | — | |
| contr-wasser-all + asrFT Data=100%, Giga Dataset=false2024.12 | 12.08 | — | |
| contr-wasser-allFT Data=100%, Giga Dataset=true2024.12 | 12.1 | — | |
| ASR pretrainFT Data=10%, Giga Dataset=true2024.12 | 12.16 | — | |
| ASR pretrainFT Data=10%, Giga Dataset=false2024.12 | 12.21 | — | |
| contr-wasser-allFT Data=10%, Giga Dataset=true2024.12 | 12.29 | — | |
| contr-cos-allFT Data=100%, Giga Dataset=false2024.12 | 12.56 | — | |
| contr-wasser-allFT Data=10%, Giga Dataset=false2024.12 | 12.92 | — | |
| contr-cos-allFT Data=10%, Giga Dataset=false2024.12 | 13.06 | — | |
| contr-cos-embFT Data=10%, Giga Dataset=false2024.12 | 13.98 | — | |
| contr-cos-embFT Data=10%, Giga Dataset=true2024.12 | 14.24 | — | |
| contr-wasser-all + asrFT Data=10%, Giga Dataset=true2024.12 | 15.13 | — | |
| w2vu2-CTCLearning Paradigm=Unsupervised learning, Decoding Method=4-gram language model2022.10 | 15.7 | 12.7 | |
| contr-wasser-embFT Data=10%, Giga Dataset=false2024.12 | 15.99 | — | |
| contr-wasser-embFT Data=10%, Giga Dataset=true2024.12 | 16.36 | — | |
| TransformerLearning Paradigm=Supervised learning2022.10 | 32.6 | 12.1 | |
| BLSP-lslm-7bFT Data=N/A, Giga Dataset=false2024.12 | 44.51 | — |