Automatic Speech Recognition on MuST-C
0.8308LASERshas+XLR-LaBSE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| shas+XLR-LaBSEASR Model=whisper, BT Model=madlad2025.11 | 0.8308 | 18.65 | 12.73 | |
| shas+XLR-LaBSEASR Model=whisper, BT Model=nllb2025.11 | 0.8307 | 18.84 | 12.94 | |
| shas+XLR-SimAlignASR Model=whisper, BT Model=madlad2025.11 | 0.8292 | 17.76 | 11.61 | |
| shas+XLR-SimAlignASR Model=whisper, BT Model=nllb2025.11 | 0.8283 | 18.05 | 11.93 | |
| manual audio segASR Model=whisper2025.11 | 0.8256 | 12.21 | 6.97 | |
| shas+XLR-LaBSEASR Model=owsm, BT Model=madlad2025.11 | 0.8232 | 20.84 | 15.43 | |
| shas+XL-SegmenterASR Model=whisper, BT Model=madlad2025.11 | 0.8229 | 20.6 | 14.46 | |
| shas+XLR-SimAlignASR Model=owsm, BT Model=madlad2025.11 | 0.8229 | 19.64 | 14.02 | |
| shas+XLR-LaBSEASR Model=owsm, BT Model=nllb2025.11 | 0.8227 | 21.08 | 15.7 | |
| shas+XLR-SimAlignASR Model=owsm, BT Model=nllb2025.11 | 0.8217 | 20.06 | 14.47 | |
| shas+XL-SegmenterASR Model=whisper, BT Model=nllb2025.11 | 0.8194 | 21.47 | 15.49 | |
| manual audio segASR Model=owsm2025.11 | 0.8176 | 13.66 | 9.37 | |
| shas+XL-SegmenterASR Model=owsm, BT Model=madlad2025.11 | 0.8162 | 22.49 | 16.95 | |
| shas+XL-SegmenterASR Model=owsm, BT Model=nllb2025.11 | 0.812 | 23.39 | 17.95 | |
| manual audio segASR Model=seamless2025.11 | 0.806 | 22.01 | 18.53 | |
| shas+XLR-LaBSEASR Model=seamless, BT Model=madlad2025.11 | 0.7315 | 51.03 | 46.76 | |
| shas+XLR-LaBSEASR Model=seamless, BT Model=nllb2025.11 | 0.7312 | 51.2 | 46.95 | |
| shas+XL-SegmenterASR Model=seamless, BT Model=madlad2025.11 | 0.7286 | 48.07 | 43.83 | |
| shas+XLR-SimAlignASR Model=seamless, BT Model=madlad2025.11 | 0.7283 | 48.04 | 43.66 | |
| shas+XLR-SimAlignASR Model=seamless, BT Model=nllb2025.11 | 0.7274 | 48.37 | 44.03 | |
| shas+XL-SegmenterASR Model=seamless, BT Model=nllb2025.11 | 0.7253 | 48.76 | 44.58 |