Audio Classification on AudioSet-2M (full)
48.6mAPBEATSiter3+
Evaluation Results
| Method | Links | |
|---|---|---|
| BEATSiter3+#Param=90M, Pre-training Data=AS, Pre-training Category=Self-Supervised, Knowledge Distillation=extra pseudo-labels2024.01 | 48.6 | |
| EAT#Param=88M, Pre-training Data=AS, Pre-training Category=Ours2024.01 | 48.6 | |
| BEATSiter2#Param=90M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 48.1 | |
| BEATSiter3#Param=90M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 48 | |
| BEATSiter1#Param=90M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 47.9 | |
| Audio-MAE (local)Backbone=ViT-B, PT-Data=AS2022.07 | 47.3 | |
| Audio-MAE#Param=86M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 47.3 | |
| MaskSpecBackbone=ViT-B, PT-Data=AS2022.07 | 47.1 | |
| HTS-ATBackbone=Swin-B, PT-Data=IN, Additional Supervised Training=AS-2M2022.07 | 47.1 | |
| PaSSTBackbone=DeiT-B, PT-Data=IN, Additional Supervised Training=AS-2M2022.07 | 47.1 | |
| PassT#Param=86M, Pre-training Data=IN, Pre-training Category=Supervised2024.01 | 47.1 | |
| HTS-AT#Param=31M, Pre-training Data=IN, Pre-training Category=Supervised2024.01 | 47.1 | |
| MaskSpec#Param=86M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 47.1 | |
| Audio-MAE (global)Backbone=ViT-B, PT-Data=AS2022.07 | 46.8 | |
| ASTBackbone=DeiT-B, PT-Data=IN2022.07 | 45.9 | |
| AST#Param=86M, Pre-training Data=IN, Pre-training Category=Supervised2024.01 | 45.9 | |
| ERANNBackbone=CNN, PT-Data=None2022.07 | 45 | |
| PSLABackbone=EffNet, PT-Data=IN2022.07 | 44.4 | |
| PSLA#Param=14M, Pre-training Data=IN, Pre-training Category=Supervised2024.01 | 44.4 | |
| MBTBackbone=ViT-B, PT-Data=IN-21K2022.07 | 44.3 | |
| MBT#Param=86M, Pre-training Data=IN-21K, Pre-training Category=Supervised2024.01 | 44.3 | |
| PANNBackbone=CNN, PT-Data=None2022.07 | 43.1 | |
| PANN#Param=81M, Pre-training Data=Not Specified, Pre-training Category=Supervised2024.01 | 43.1 | |
| ConformerBackbone=Conformer, PT-Data=AS2022.07 | 41.1 | |
| Conformer#Param=88M, Pre-training Data=AS, Pre-training Category=Self-Supervised2024.01 | 41.1 | |
| AudioCLIP#Param=93M, Pre-training Data=TI+AS, Pre-training Category=Supervised2024.01 | 25.9 | |
| BEATSSL Data=AS, ensemble_size=10 models2022.12 | 0.506 | |
| BEATSSL Data=AS, ensemble_size=5 models2022.12 | 0.504 | |
| PaSSTSL Data=IN+AS2022.12 | 0.496 | |
| HTS-ATSL Data=IN+AS2022.12 | 0.487 | |
| ASTSL Data=IN+AS2022.12 | 0.485 | |
| PSLASL Data=IN+AS2022.12 | 0.474 |