Automatic Speech Recognition on LSVSC (test)
5.83WEROur-Transformer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Our-TransformerSetup=Fully Supervise (S), #Params=25.9M, Time(s)=0.152026.05 | 5.83 | 3.58 | |
| Our-ConformerSetup=Fully Supervise (S), #Params=28.0M, Time(s)=0.142026.05 | 5.84 | 3.62 | |
| Transformer + adaptSASetup=Fully Supervise (S), #Params=26.3M, Time(s)=0.162026.05 | 6.85 | 3.9 | |
| Transformer + fixedSASetup=Fully Supervise (S), #Params=26.3M, Time(s)=0.162026.05 | 7.24 | 4.17 | |
| TransformerSetup=Fully Supervise (S), #Params=26.3M, Time(s)=0.162026.05 | 8.01 | 4.68 | |
| LAS + fixedSASetup=Fully Supervise (S)2026.05 | 8.53 | 5.05 | |
| ChunkFormerSetup=Fully Supervise (S), #Params=110M2026.05 | 8.85 | — | |
| LASSetup=Fully Supervise (S)2026.05 | 9.73 | 5.79 | |
| Wav2Vec2-base-viSetup=Fine-Tuning (FT), #Params=95M2026.05 | 9.89 | — | |
| PhoWhisper-largeSetup=Fine-Tuning (FT), #Params=1.5B2026.05 | 10.08 | — | |
| ZipformerSetup=Fully Supervise (S), #Params=65M2026.05 | 10.23 | — | |
| PhoWhisper-mediumSetup=Fine-Tuning (FT), #Params=769M2026.05 | 10.25 | — | |
| ViSpeechFormerDecoding Level=phoneme, Decoder Parameters=2,007,8922026.02 | 10.39 | 5.3 | |
| TASADecoding Level=subword, Decoder Parameters=2,605,0412026.02 | 10.62 | 6.73 | |
| Speech TransformerDecoding Level=character, Decoder Parameters=1,249,9202026.02 | 11.16 | 6.04 | |
| PhoWhisper-baseSetup=Fine-Tuning (FT), #Params=244M2026.05 | 11.23 | — | |
| Conv-TransformerDecoding Level=subword, Decoder Parameters=2,559,0892026.02 | 12.59 | 7.43 | |
| ZipFormerDecoding Level=subword, Decoder Parameters=4,302,0322026.02 | 13.33 | 8.88 | |
| ConformerDecoding Level=subword, Decoder Parameters=4,302,0322026.02 | 15.71 | 10.61 | |
| Multi-ConvFormerDecoding Level=subword, Decoder Parameters=4,302,0322026.02 | 15.77 | 10.58 |