Audio-Visual Automatic Speech Recognition on Ego4D zero-shot
64.75WERAVFormer
Evaluation Results
| Method | Links | |
|---|---|---|
| AVFormerModality=A+V, LibriSpeech PT=true, HowTo100M Pretrained Params=VP + Adapters, HowTo100M PT Data %=52023.03 | 64.75 | |
| BEST-RQModality=A, LibriSpeech PT=true, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 68.34 | |
| AVATARModality=A+V, LibriSpeech PT=true, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 71.97 | |
| BEST-RQModality=A, LibriSpeech PT=false, HowTo100M Pretrained Params=None2023.03 | 77.98 | |
| AVATARModality=A+V, LibriSpeech PT=false, HowTo100M Pretrained Params=All, HowTo100M PT Data %=1002023.03 | 92.03 | |
| AVATARModality=A, LibriSpeech PT=true, HowTo100M Pretrained Params=None2023.03 | 110.86 |