Supervised Event Localization on AVE
82.3Audio-only AccuracyAudiovisual Masked Autoencoder
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Audiovisual Masked AutoencoderPre-training dataset=AudioSet, Epochs=80, Backbone=ViT-Base2022.12 | 82.3 | 77.6 | 88.6 | |
| Audiovisual Masked AutoencoderPre-training dataset=VGGSound, Epochs=800, Backbone=ViT-Base2022.12 | 81.3 | 78.2 | 90.2 | |
| Senocak et al.2022.12 | 79.1 | 76.1 | 87.8 |