Audio-Visual Automatic Speech Recognition on How2 zero-shot
13.69WERAVFormer
Evaluation Results
| Method | Links | |
|---|---|---|
| AVFormerModality=A+V, LibriSpeech PT=true, HowTo100M Pretrained Params=VP + Adapters, HowTo100M PT Data %=52023.03 | 13.69 | |
| BEST-RQModality=A, LibriSpeech PT=true, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 15.32 | |
| AVATARModality=A+V, LibriSpeech PT=false, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 17.23 | |
| AVATARModality=A+V, LibriSpeech PT=true, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 18.37 | |
| BEST-RQModality=A, LibriSpeech PT=false, HowTo100M Pretrained Params=None2023.03 | 21.9 | |
| AVATARModality=A, LibriSpeech PT=true, HowTo100M Pretrained Params=None2023.03 | 39.43 |