Automatic Speech Recognition on HKUST
13.7Sub Error RateUMA + self-condition
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| UMA + self-conditionEncoder=E-Branchformer, Category=NAR2023.09 | 13.7 | 2.6 | 2.9 | 19.2 | |
| Hybrid CTC/Attention + beam searchEncoder=E-Branchformer, Category=AR, Decoding=Beam Search2023.09 | 14.1 | 2.3 | 2.8 | 19.3 | |
| UMAEncoder=E-Branchformer, Category=NAR2023.09 | 14.1 | 3.4 | 2.6 | 20.1 | |
| UMA + self-conditionEncoder=Conformer, Category=NAR2023.09 | 14.4 | 2.6 | 3.1 | 20 | |
| Self-conditioned CTCEncoder=E-Branchformer, Category=NAR2023.09 | 14.9 | 2.5 | 3 | 20.4 | |
| Hybrid CTC/AttentionEncoder=E-Branchformer, Category=AR2023.09 | 15.2 | 2.3 | 3.1 | 20.6 | |
| UMAEncoder=Conformer, Category=NAR2023.09 | 15.6 | 2.7 | 3.2 | 21.4 | |
| Hybrid CTC/Attention + beam searchEncoder=Conformer, Category=AR, Decoding=Beam Search2023.09 | 15.7 | 2.5 | 3 | 21.2 | |
| UMA + self-conditionEncoder=Transformer, Category=NAR2023.09 | 15.8 | 3.9 | 2.8 | 22.6 | |
| Hybrid CTC/Attention + beam searchEncoder=Transformer, Category=AR, Decoding=Beam Search2023.09 | 15.9 | 2.8 | 2.8 | 21.6 | |
| UMAEncoder=Transformer, Category=NAR2023.09 | 15.9 | 6.5 | 2.6 | 25 | |
| CTCEncoder=E-Branchformer, Category=NAR2023.09 | 16 | 2.6 | 2.9 | 21.6 | |
| Self-conditioned CTCEncoder=Conformer, Category=NAR2023.09 | 16.3 | 2.6 | 3.2 | 22.1 | |
| Hybrid CTC/AttentionEncoder=Conformer, Category=AR2023.09 | 16.9 | 3.1 | 3.3 | 23.3 | |
| CTCEncoder=Conformer, Category=NAR2023.09 | 17.3 | 2.8 | 3.2 | 23.2 | |
| Hybrid CTC/AttentionEncoder=Transformer, Category=AR2023.09 | 18 | 2.9 | 3.2 | 24 | |
| Self-conditioned CTCEncoder=Transformer, Category=NAR2023.09 | 18.3 | 2.9 | 3.3 | 24.5 | |
| CTCEncoder=Transformer, Category=NAR2023.09 | 18.4 | 3 | 3.3 | 24.7 |