Audio Classification on AudioSet 20K
47.8mAPCAT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CAT#Param=91M, Pre-training Data=AS2026.01 | 47.8 | — | — | — | |
| CEDFine-tuning=true2024.06 | 44 | — | — | — | |
| AudioMosaicBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 42.5 | — | — | — | |
| BEATS_iter3+# Params=90M, Fine-tuning=true2024.04 | 41.8 | — | — | — | |
| M2D-AS/0.7# Params=86M, Masking ratio=0.7, Fine-tuning=true2024.04 | 41.8 | — | — | — | |
| BEATsFine-tuning=true, # Params=90M, Iteration=3+2024.04 | 41.8 | — | — | — | |
| BEATs iter3+Fine-tuning=true2024.06 | 41.8 | — | — | — | |
| M2D-CLAPFine-tuning=true, masking ratio=0.72024.06 | 41.8 | — | — | — | |
| M2D-CLAP#Param=86M, Pre-training Data=TA+AS2026.01 | 41.8 | — | — | — | |
| ASDA#Param=93M, Pre-training Data=AS2026.01 | 41.5 | — | — | — | |
| BAT# Params=91M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 41.32 | — | — | — | |
| SSLAM# Params=88M, Data=AS-2M, Source=Reported, Evaluation Protocol=Fine-tuning (FT)2026.02 | 40.9 | — | — | — | |
| SSLAMBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 40.9 | — | — | — | |
| ATST-C2F# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 40.5 | — | — | — | |
| ATST-C2FFine-tuning=true2024.06 | 40.5 | — | — | — | |
| EAT# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 40.28 | — | — | — | |
| EAT#Param=88M, Pre-training Data=AS2024.01 | 40.2 | — | — | — | |
| EAT#Param=88M, Pre-training Data=AS2026.01 | 40.2 | — | — | — | |
| EAT# Params=88M, Data=AS-2M, Source=Reported, Evaluation Protocol=Fine-tuning (FT)2026.02 | 40.2 | — | — | — | |
| EATBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 40.2 | — | — | — | |
| SSLAM# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Fine-tuning (FT)2026.02 | 39.97 | — | — | — | |
| ATST-Frame# Param=86M, Pre-training data=AS2023.06 | 39 | — | — | — | |
| ATST-F2C# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 39 | — | — | — | |
| ATST-FrameFine-tuning=true2024.06 | 39 | — | — | — | |
| ATST-Frame#Param=86M, Pre-training Data=AS2026.01 | 39 | — | — | — | |
| BEATS_iter3+#Param=90M, Pre-training Data=AS2022.12 | 38.9 | — | — | — | |
| BEATSiter3+# Param=90M, Pre-training data=AS, knowledge distillation=true2023.06 | 38.9 | — | — | — | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Knowledge Distillation=extra pseudo-labels2024.01 | 38.9 | — | — | — | |
| BEATs_iter3+#Param=90M, Pre-training Data=AS2026.01 | 38.9 | — | — | — | |
| M2D/0.7# Params=86M, Masking ratio=0.7, Fine-tuning=true2024.04 | 38.6 | — | — | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.72024.04 | 38.6 | — | — | — | |
| SupMAM-CLAPFine-tuning=true2024.06 | 38.6 | — | — | — | |
| M2DFine-tuning=true, masking ratio=0.72024.06 | 38.6 | — | — | — | |
| ASiT#Param=86M, Pre-training Data=AS2026.01 | 38.6 | — | — | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.62024.04 | 38.4 | — | — | — | |
| M2DFine-tuning=true, masking ratio=0.62024.06 | 38.4 | — | — | — | |
| A-JEPA#Param=86M, Pre-training Data=AS2026.01 | 38.4 | — | — | — | |
| A-JEPABackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=354M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 38.4 | — | — | — | |
| BEATS_iter2#Param=90M, Pre-training Data=AS2022.12 | 38.3 | — | — | — | |
| BEATS_iter3#Param=90M, Pre-training Data=AS2022.12 | 38.3 | — | — | — | |
| BEATSiter3# Param=90M, Pre-training data=AS2023.06 | 38.3 | — | — | — | |
| BEATSiter2#Param=90M, Pre-training Data=AS2024.01 | 38.3 | — | — | — | |
| BEATSiter3#Param=90M, Pre-training Data=AS2024.01 | 38.3 | — | — | — | |
| BEATsFine-tuning=true, # Params=90M, Iteration=32024.04 | 38.3 | — | — | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.7, Target input strategy=all patches to target2024.04 | 38.3 | — | — | — | |
| BEATs iter3Fine-tuning=true2024.06 | 38.3 | — | — | — | |
| BEATs_iter3#Param=90M, Pre-training Data=AS2026.01 | 38.3 | — | — | — | |
| BEATsiter3Backbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=182M, Fine-tuning Parameters=91M, Evaluation Protocol=fine-tuning2026.05 | 38.3 | — | — | — | |
| ATST-Clip# Param=86M, Pre-training data=AS2023.06 | 37.9 | — | — | — | |
| MSM-MAEFine-tuning=true, # Params=86M, Masking ratio=0.752024.04 | 37.9 | — | — | — | |
| ATST-ClipFine-tuning=true2024.06 | 37.9 | — | — | — | |
| MSM-MAEFine-tuning=true, masking ratio=0.752024.06 | 37.9 | — | — | — | |
| ATST-Clip#Param=86M, Pre-training Data=AS2026.01 | 37.9 | — | — | — | |
| Audio-MAE Large#Param=304M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 37.6 | — | — | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.6, Target input strategy=all patches to target2024.04 | 37.6 | — | — | — | |
| BAT# Params=91M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 37.52 | — | — | — | |
| ATST BaseEvaluation protocol=Fine-tuning2022.10 | 37.4 | — | — | — | |
| M2DEvaluation protocol=Fine-tuning, Masking ratio=0.72022.10 | 37.4 | — | — | — | |
| M2D# Param=86M, Pre-training data=AS2023.06 | 37.4 | — | — | — | |
| ATST BaseFine-tuning=true, # Params=86M2024.04 | 37.4 | — | — | — | |
| ASiTBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=96M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 37.4 | — | — | — | |
| Audio-MAE#Param=86M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 37.1 | — | — | — | |
| Audio-MAE (local)Evaluation protocol=Fine-tuning2022.10 | 37.1 | — | — | — | |
| Audio-MAE#Param=86M, Pre-training Data=AS2024.01 | 37.1 | — | — | — | |
| Audio-MAE (local)Fine-tuning=true, # Params=86M2024.04 | 37.1 | — | — | — | |
| Audio-MAE#Param=86M, Pre-training Data=AS2026.01 | 37.1 | — | — | — | |
| Audio-MAE (local)# Param=86M, Pre-training data=AS2023.06 | 37 | — | — | — | |
| Audio-MAEBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=137M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 37 | — | — | — | |
| M2DEvaluation protocol=Fine-tuning, Masking ratio=0.62022.10 | 36.8 | — | — | — | |
| MSM-MAEEvaluation protocol=Fine-tuning2022.10 | 36.7 | — | — | — | |
| MSM-MAE# Param=86M, Pre-training data=AS2023.06 | 36.7 | — | — | — | |
| CLAP#Param=86M, Pre-training Data=TA2026.01 | 36.7 | — | — | — | |
| BEATS_iter1#Param=90M, Pre-training Data=AS2022.12 | 36 | — | — | — | |
| BEATSiter1#Param=90M, Pre-training Data=AS2024.01 | 36 | — | — | — | |
| ASIT# Param=85M, Pre-training data=AS2023.06 | 35.2 | — | — | — | |
| EAT# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 35.2 | — | — | — | |
| AST#Param=86M, Pre-training Data=IN, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 34.7 | — | — | — | |
| AST (Single), AST-P/SEvaluation protocol=Fine-tuning2022.10 | 34.7 | — | — | — | |
| AST# Param=86M, Pre-training data=AS2023.06 | 34.7 | — | — | — | |
| MaskSpec# Param=86M, Pre-training data=AS2023.06 | 34.7 | — | — | — | |
| AST#Param=86M, Pre-training Data=IN2024.01 | 34.7 | — | — | — | |
| AST (Single)# Params=86M, Fine-tuning=true2024.04 | 34.7 | — | — | — | |
| ASTFine-tuning=true, # Params=86M, Version=Single2024.04 | 34.7 | — | — | — | |
| AST#Param=86M, Pre-training Data=IN2026.01 | 34.7 | — | — | — | |
| ASTBackbone=ViT-B/16, Pre-training Data=IN, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 34.7 | — | — | — | |
| SSLAM# Params=88M, Data=AS-2M, Source=Our tuning/probing, Evaluation Protocol=Convex Gated Probing (CGP)2026.02 | 34.62 | — | — | — | |
| data2vec#Param=94M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 34.5 | — | — | — | |
| data2vecEvaluation protocol=Fine-tuning2022.10 | 34.5 | — | — | — | |
| data2vec# Param=94M, Pre-training data=AS2023.06 | 34.5 | — | — | — | |
| data2vec#Param=94M, Pre-training Data=AS2024.01 | 34.5 | — | — | — | |
| data2vecFine-tuning=true, # Params=94M2024.04 | 34.5 | — | — | — | |
| data2vec#Param=94M, Pre-training Data=AS2026.01 | 34.5 | — | — | — | |
| Data2Vec 2.0Backbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=94M, Fine-tuning Parameters=94M, Evaluation Protocol=fine-tuning2026.05 | 34.5 | — | — | — | |
| CAV-MAE#Param=86M, Pre-training Data=AS+IN, Pre-training Type=Self-Supervised Pre-Training2022.12 | 34.2 | — | — | — | |
| MaskSpec#Param=86M, Pre-training Data=AS, Pre-training Type=Self-Supervised Pre-Training2022.12 | 32.3 | — | — | — | |
| MaskSpecEvaluation protocol=Fine-tuning2022.10 | 32.3 | — | — | — | |
| MaskSpec#Param=86M, Pre-training Data=AS2024.01 | 32.3 | — | — | — | |
| MaskSpecFine-tuning=true, # Params=86M2024.04 | 32.3 | — | — | — | |
| MaskSpec#Param=86M, Pre-training Data=AS2026.01 | 32.3 | — | — | — | |
| MaskSpecBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=112M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 32.3 | — | — | — |