Audio Event Tagging on AudioSet AS-2M (full)
50.2mAPSSLAM
Evaluation Results
| Method | Links | |
|---|---|---|
| SSLAM#Param=88M, Pre-training Data=AS2025.06 | 50.2 | |
| CEDType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 50 | |
| SPEARs+a XLarge# Params=600M, Pre-train data=197k2025.10 | 50 | |
| SPEARa Large# Params=327M, Pre-train data=13k2025.10 | 49.8 | |
| ATST-C2FType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 49.7 | |
| SPEARa Large# Params=327M, Pre-train data=5k2025.10 | 49.7 | |
| SPEARs+a Large# Params=327M, Pre-train data=97k2025.10 | 49.6 | |
| SPEARa Base# Params=94M, Pre-train data=5k2025.10 | 49.3 | |
| SPEARa Base# Params=94M, Pre-train data=13k2025.10 | 49.3 | |
| M2D-CLAP2025 stage1Type=Audio-Language model, Evaluation Protocol=Fine-tuning2025.03 | 49 | |
| DyMN-LType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 49 | |
| DASS-MediumParams=49M, Pretrain=IN SL, Teacher ensemble=AST + HTS-AT2024.07 | 48.9 | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Supervised Fine-tuning=Included2025.06 | 48.6 | |
| A-JEPA#Param=86M, Pre-training Data=AS2025.06 | 48.6 | |
| EAT#Param=88M, Pre-training Data=AS2025.06 | 48.6 | |
| BEATs(iter3)Params=90M, Pretrain=SSL2024.07 | 48.6 | |
| EATParams=88M, Pretrain=SSL2024.07 | 48.6 | |
| DASS-SmallParams=30M, Pretrain=IN SL, Teacher ensemble=AST + HTS-AT2024.07 | 48.6 | |
| BEATSiter3+Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 48.6 | |
| DTF-AT Full TFType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 48.6 | |
| BEATs# Params=90M, Pre-train data=5k2025.10 | 48.6 | |
| EAT# Params=88M, Pre-train data=5k2025.10 | 48.6 | |
| SPEARs+a Base# Params=94M, Pre-train data=97k2025.10 | 48.6 | |
| M2D-CLAP2024 stage1Type=Ablation, Evaluation Protocol=Fine-tuning2025.03 | 48.5 | |
| SupMAM-CLAPType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 48.5 | |
| BEATSiter3#Param=90M, Pre-training Data=AS2025.06 | 48 | |
| ASIT#Param=86M, Pre-training Data=AS2025.06 | 48 | |
| BEATSiter3Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 48 | |
| ATST-FrameType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 48 | |
| ATST Frame# Params=86M, Pre-train data=5k2025.10 | 48 | |
| M2DType=Baseline, Evaluation Protocol=Fine-tuning2025.03 | 47.9 | |
| DASS-MediumParams=49M, Pretrain=IN SL2024.07 | 47.6 | |
| Audio-MAE#Param=86M, Pre-training Data=AS2025.06 | 47.3 | |
| Audio-MAEParams=86M, Pretrain=SSL2024.07 | 47.3 | |
| DASS-SmallParams=30M, Pretrain=IN SL2024.07 | 47.2 | |
| MaskSpec#Param=86M, Pre-training Data=AS2025.06 | 47.1 | |
| HTS-ATParams=31M, Pretrain=IN SL2024.07 | 47.1 | |
| PaSSTPretrain=IN SL2024.07 | 47.1 | |
| HTS-ATType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 47.1 | |
| ASTParams=87M, Pretrain=IN SL2024.07 | 45.9 | |
| ATST-ClipType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 45.2 | |
| Audio MambaParams=40M, Pretrain=IN SL2024.07 | 44 | |
| SPEARs Large# Params=327M, Pre-train data=84k2025.10 | 43.9 | |
| SPEARs Base# Params=94M, Pre-train data=84k2025.10 | 43.6 | |
| AuMParams=26M, Pretrain=IN SL2024.07 | 39.7 |