Audio Event Tagging on AudioSet (AS-20K)
46.7mAPM2D-CLAP2025
Evaluation Results
| Method | Links | |
|---|---|---|
| M2D-CLAP2025Type=Ablation, Config=Fine-tuned to AudioSet in stage 1.1, Evaluation Protocol=Fine-tuning2025.03 | 46.7 | |
| CEDType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 44 | |
| M2D-CLAP2025 stage1Type=Audio-Language model, Evaluation Protocol=Fine-tuning2025.03 | 42.1 | |
| BEATSiter3+Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 41.8 | |
| M2D-CLAP2024 stage1Type=Ablation, Evaluation Protocol=Fine-tuning2025.03 | 41.8 | |
| SSLAM#Param=88M, Pre-training Data=AS2025.06 | 40.9 | |
| SSLAMParams=88M, Fine-tuned=true2026.06 | 40.9 | |
| USAD 2.0 XLarge+Params=695M, Fine-tuned=true, Teachers=Supervised2026.06 | 40.9 | |
| USAD 2.0 Large+Params=336M, Fine-tuned=true, Teachers=Supervised2026.06 | 40.6 | |
| ATST-C2FType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 40.5 | |
| EAT#Param=88M, Pre-training Data=AS2025.06 | 40.2 | |
| EATParams=88M, Fine-tuned=true2026.06 | 40.2 | |
| USAD 2.0 LargeParams=336M, Fine-tuned=true, Teachers=Self-supervised2026.06 | 40.1 | |
| USAD 2.0 BaseParams=97M, Fine-tuned=true, Teachers=Self-supervised2026.06 | 40 | |
| SPEAR XLargeParams=600M, Fine-tuned=true2026.06 | 39.4 | |
| SPEAR LargeParams=327M, Fine-tuned=true2026.06 | 39.2 | |
| SPEAR BaseParams=94M, Fine-tuned=true2026.06 | 39.1 | |
| ATST-FrameType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 39 | |
| ATST FrameParams=86M, Fine-tuned=true2026.06 | 39 | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Supervised Fine-tuning=Included2025.06 | 38.9 | |
| ASIT#Param=86M, Pre-training Data=AS2025.06 | 38.6 | |
| M2DType=Baseline, Evaluation Protocol=Fine-tuning2025.03 | 38.6 | |
| SupMAM-CLAPType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 38.6 | |
| A-JEPA#Param=86M, Pre-training Data=AS2025.06 | 38.4 | |
| BEATSiter3#Param=90M, Pre-training Data=AS2025.06 | 38.3 | |
| BEATSiter3Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 38.3 | |
| BEATs iter3Params=90M, Fine-tuned=true2026.06 | 38.3 | |
| ATST-ClipType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 37.9 | |
| USAD LargeParams=336M, Fine-tuned=true2026.06 | 37.4 | |
| USAD 2.0 SmallParams=25M, Fine-tuned=true, Teachers=Self-supervised2026.06 | 37.2 | |
| Audio-MAE#Param=86M, Pre-training Data=AS2025.06 | 37.1 | |
| USAD BaseParams=97M, Fine-tuned=true2026.06 | 35.7 | |
| data2vec#Param=94M, Pre-training Data=AS2025.06 | 34.5 | |
| USAD SmallParams=25M, Fine-tuned=true2026.06 | 34.5 | |
| ATST-BaseEvaluation protocol=Linear evaluation2022.04 | 33.8 | |
| MaskSpec#Param=86M, Pre-training Data=AS2025.06 | 32.3 | |
| SS-AST#Param=89M, Pre-training Data=AS+LS2025.06 | 31 | |
| MAE-AST#Param=86M, Pre-training Data=AS+LS2025.06 | 30.6 | |
| ATST-SmallEvaluation protocol=Linear evaluation2022.04 | 27.9 |