Audio recognition on VGG-Sound (test)
64.1Top-1 AccMBT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MBTModalities=Audio, Visual2021.06 | 64.1 | 85.6 | — | — | — | |
| MASTPretrained Weights=ImageNet-1K2023.03 | 57 | 81.3 | — | — | — | |
| Slow-FastFusion=Lateral connections (Proposed)2021.03 | 52.46 | 78.12 | 54.4 | 97.4 | 2.761 | |
| MBTModalities=Audio2021.06 | 52.3 | 78.1 | — | — | — | |
| AST2023.03 | 52.3 | 78.1 | — | — | — | |
| MBTModalities=Visual2021.06 | 51.2 | 72.6 | — | — | — | |
| Chen et al.2021.03 | 51 | 76.4 | 53.2 | 97.3 | 2.735 | |
| AudioSlowFastModalities=Audio2021.06 | 50.1 | 77.9 | — | — | — | |
| AudioSlowFast2023.03 | 50.1 | 77.9 | — | — | — | |
| Chen et al.Modalities=Audio2021.06 | 48.8 | 76.5 | — | — | — | |
| Chen et al.2023.03 | 48.8 | 76.5 | — | — | — | |
| Slow-FastFusion=Late fusion2021.03 | 46.75 | 73.9 | 49.8 | 97.1 | 2.671 | |
| LAION-CLAPfine-tuning=false, augmentation=keyword-to-caption augmentation2023.04 | 46.2 | — | — | — | — | |
| Two Slow StreamsArchitecture=Two streams (both slow)2021.03 | 45.8 | 72.78 | 48.2 | 96.9 | 2.633 | |
| Slow ResNet101Backbone=ResNet1012021.03 | 45.6 | 72.27 | 47.6 | 96.8 | 2.615 | |
| SlowStream=Slow only2021.03 | 45.2 | 72.53 | 47.2 | 96.7 | 2.607 | |
| B.3training_setup=Monolingual (EN), fine-tuning=false2023.04 | 43.49 | — | — | — | — | |
| B.5training_setup=Multilingual (+EFJ), fine-tuning=false2023.04 | 42.96 | — | — | — | — | |
| BLATfine-tuning=false2023.04 | 42.9 | — | — | — | — | |
| B.4training_setup=Bilingual, fine-tuning=false2023.04 | 41.95 | — | — | — | — | |
| FastStream=Fast only2021.03 | 41.44 | 70.68 | 44.2 | 96.6 | 2.576 | |
| McDonnell & Gao2021.03 | 39.74 | 71.65 | 40.3 | 96.3 | 2.532 |