Audio Classification on AudioSet 2M
50.5mAPMiCo
Evaluation Results
| Method | Links | |
|---|---|---|
| MiCoBackbone=ViT-g2024.06 | 50.5 | |
| SSLAM# Params=88M, Data=AS-2M, Source=Reported, Evaluation Protocol=Fine-tuning (FT)2026.02 | 50.2 | |
| SSLAMBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 50.2 | |
| AudioMosaicBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 50.2 | |
| CEDFine-tuning=true2024.06 | 50 | |
| ATST-C2F# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 49.7 | |
| ATST-C2FFine-tuning=true2024.06 | 49.7 | |
| BEATS_iter3+#Param=90M, Pre-training Data=AS2022.12 | 48.6 | |
| BEATSiter3+# Param=90M, Pre-training data=AS, knowledge distillation=true2023.06 | 48.6 | |
| BEATS_iter3+# Params=90M, Fine-tuning=true2024.04 | 48.6 | |
| BEATsFine-tuning=true, # Params=90M, Iteration=3+2024.04 | 48.6 | |
| BEATs iter3+Fine-tuning=true2024.06 | 48.6 | |
| Absolute SOTA2024.06 | 48.6 | |
| EAT# Params=88M, Data=AS-2M, Source=Reported, Evaluation Protocol=Fine-tuning (FT)2026.02 | 48.6 | |
| A-JEPABackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=354M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 48.6 | |
| EATBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 48.6 | |
| BAT# Params=91M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 48.55 | |
| M2D-AS/0.7# Params=86M, Masking ratio=0.7, Fine-tuning=true2024.04 | 48.5 | |
| SupMAM-CLAPFine-tuning=true2024.06 | 48.5 | |
| M2D-CLAPFine-tuning=true, masking ratio=0.72024.06 | 48.5 | |
| BEATS_iter2#Param=90M, Pre-training Data=AS2022.12 | 48.1 | |
| BEATS_iter3#Param=90M, Pre-training Data=AS2022.12 | 48 | |
| BEATSiter3# Param=90M, Pre-training data=AS2023.06 | 48 | |
| ATST-Frame# Param=86M, Pre-training data=AS2023.06 | 48 | |
| BEATsFine-tuning=true, # Params=90M, Iteration=32024.04 | 48 | |
| BEATs iter3Fine-tuning=true2024.06 | 48 | |
| ATST-FrameFine-tuning=true2024.06 | 48 | |
| BEATsiter3Backbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=182M, Fine-tuning Parameters=91M, Evaluation Protocol=fine-tuning2026.05 | 48 | |
| BEATS_iter1#Param=90M, Pre-training Data=AS2022.12 | 47.9 | |
| M2D/0.7# Params=86M, Masking ratio=0.7, Fine-tuning=true2024.04 | 47.9 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.72024.04 | 47.9 | |
| M2DFine-tuning=true, masking ratio=0.72024.06 | 47.9 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.62024.04 | 47.7 | |
| M2DFine-tuning=true, masking ratio=0.62024.06 | 47.7 | |
| SSLAM# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 47.69 | |
| EAT# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 47.61 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.7, Target input strategy=all patches to target2024.04 | 47.6 | |
| ASiTBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=96M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 47.5 | |
| Audio-MAE Large#Param=304M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 47.4 | |
| MSM-MAEFine-tuning=true, # Params=86M, Masking ratio=0.752024.04 | 47.4 | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.6, Target input strategy=all patches to target2024.04 | 47.4 | |
| MSM-MAEFine-tuning=true, masking ratio=0.752024.06 | 47.4 | |
| Audio-MAE#Param=86M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 47.3 | |
| Audio-MAE (local)# Param=86M, Pre-training data=AS2023.06 | 47.3 | |
| Audio-MAE (local)Fine-tuning=true, # Params=86M2024.04 | 47.3 | |
| Audio-MAEBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=137M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 47.3 | |
| PaSST#Param=86M, Pre-training Data=IN, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 47.1 | |
| HTS-AT#Param=31M, Pre-training Data=IN, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 47.1 | |
| PaSST#Param=86M, Pre-training Data=IN+AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 47.1 | |
| HTS-AT#Param=31M, Pre-training Data=IN+AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 47.1 | |
| MaskSpec#Param=86M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 47.1 | |
| HTS-AT# Param=31M, Pre-training data=AS2023.06 | 47.1 | |
| PassT# Param=86M, Pre-training data=AS2023.06 | 47.1 | |
| KD-AST# Param=86M, Pre-training data=AS2023.06 | 47.1 | |
| MaskSpec# Param=86M, Pre-training data=AS2023.06 | 47.1 | |
| HTS-AT# Params=31M, Fine-tuning=true2024.04 | 47.1 | |
| MaskSpecFine-tuning=true, # Params=86M2024.04 | 47.1 | |
| PaSSTFine-tuning=true, # Params=86M2024.04 | 47.1 | |
| HTS-ATFine-tuning=true, # Params=31M2024.04 | 47.1 | |
| HTS-ATFine-tuning=true2024.06 | 47.1 | |
| MaskSpecBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=112M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 47.1 | |
| ATST-F2C# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 46.8 | |
| AST#Param=86M, Pre-training Data=IN, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 45.9 | |
| AST#Param=86M, Pre-training Data=IN+AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 45.9 | |
| AST# Param=86M, Pre-training data=AS2023.06 | 45.9 | |
| AST (Single)# Params=86M, Fine-tuning=true2024.04 | 45.9 | |
| ASTFine-tuning=true, # Params=86M, Version=Single2024.04 | 45.9 | |
| ASTBackbone=ViT-B/16, Pre-training Data=IN, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 45.9 | |
| ATST-Clip# Param=86M, Pre-training data=AS2023.06 | 45.2 | |
| ATST-ClipFine-tuning=true2024.06 | 45.2 | |
| ERANN#Param=55M, Pre-training Type=No Pre-Training2022.12 | 45 | |
| ERANNBackbone=CNN, Fine-tuning Parameters=57M, Evaluation Protocol=fine-tuning2026.05 | 45 | |
| CAV-MAE#Param=86M, Pre-training Data=AS+IN, Pre-training Type=Self-Supervised Pre-Training2022.12 | 44.9 | |
| PSLA#Param=14M, Pre-training Data=IN, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 44.4 | |
| PSLA# Param=14M, Pre-training data=AS2023.06 | 44.4 | |
| MBT#Param=86M, Pre-training Data=IN-21K, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 44.3 | |
| MBTBackbone=ViT-B/16, Pre-training Data=IN-21K, Pre-training Parameters=343M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 44.3 | |
| PANN# Param=81M, Pre-training data=AS2023.06 | 43.9 | |
| ImageBindBackbone=ViT-H2024.06 | 43.4 | |
| PANN#Param=81M, Pre-training Type=No Pre-Training2022.12 | 43.1 | |
| PANNBackbone=CNN, Fine-tuning Parameters=81M, Evaluation Protocol=fine-tuning2026.05 | 43.1 | |
| BAT# Params=91M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 42.9 | |
| EAT-S/MFine-tuning=true, # Params=25.5M2024.04 | 42.6 | |
| Conformer-Based# Param=88M, Pre-training data=67K hours2023.06 | 41.5 | |
| Conformer-SSLBackbone=Conformer, Pre-training Data=AS, Pre-training Parameters=88M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 41.1 | |
| EAT# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 41.04 | |
| A-RWKV-B/16Training Protocol=from-scratch, Precision=bf162025.09 | 40.91 | |
| SSLAM# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 40.18 | |
| Meta-TransformerBackbone=ViT-L2024.06 | 38.9 | |
| AST-B/16Training Protocol=from-scratch, Precision=bf162025.09 | 35.23 | |
| BAT# Params=91M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Linear Probing (LP)2026.02 | 34.27 | |
| AuM-B/16Training Protocol=from-scratch2025.09 | 32.43 | |
| EAT# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Linear Probing (LP)2026.02 | 30.36 | |
| AST-B/16Training Protocol=from-scratch2025.09 | 29.1 | |
| SSLAM# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Linear Probing (LP)2026.02 | 28.92 | |
| AudioMosaicProbing mode=Linear probing, Encoder=Frozen2026.05 | 28.7 | |
| AudioCLIP#Param=93M, Pre-training Data=TI+AS, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 25.9 | |
| AudioCLIPBackbone=ESResNeXt, Pre-training Data=TI+AS, Pre-training Parameters=134M, Fine-tuning Parameters=93M, Evaluation Protocol=fine-tuning2026.05 | 25.9 | |
| Audio-MAEProbing mode=Linear probing, Encoder=Frozen2026.05 | 20.5 | |
| SSLAMProbing mode=Linear probing, Encoder=Frozen2026.05 | 19.5 |