Sound Event Tagging on FSD50K (test)
69.7mAPONE-PEACE
Evaluation Results
| Method | Links | |
|---|---|---|
| ONE-PEACE2023.10 | 69.7 | |
| MNWidth Multiplier (alpha)=3.02023.10 | 65.6 | |
| DyMN-LWidth Multiplier (alpha)=2.02023.10 | 65.5 | |
| MNWidth Multiplier (alpha)=2.02023.10 | 65.4 | |
| PaSST-S2023.10 | 65.3 | |
| PaSST (IN+AS)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 65.3 | |
| MNWidth Multiplier (alpha)=1.02023.10 | 65.1 | |
| DyMN-MWidth Multiplier (alpha)=1.02023.10 | 64.2 | |
| DyMN-SWidth Multiplier (alpha)=0.42023.10 | 61.9 | |
| MNWidth Multiplier (alpha)=0.42023.10 | 59.7 | |
| LHGNN#Params=31M, Pretrain=true2025.01 | 59 | |
| CLAP2023.10 | 58.6 | |
| ATST-ClipProtocol=Linear evaluation2023.06 | 58.5 | |
| OpenBEATs (2025)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 57.5 | |
| AST#Params=87M, Pretrain=true2025.01 | 57.4 | |
| LHGNN#Params=31M, Pretrain=false2025.01 | 57.3 | |
| ViT-B (ImageNet SL)Pre-train Data=IN-1k, Training Protocol=Fine-tuning2026.06 | 57.3 | |
| Ishikawa et al. (Shaders1k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 56.3 | |
| BEATs (iter3+)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 56.2 | |
| PSLA#Params=13.6M, Pretrain=true2025.01 | 55.9 | |
| ATST-FrameProtocol=Linear evaluation2023.06 | 55.1 | |
| AudioPGPre-train Data=Proc. Audio, Training Protocol=Fine-tuning2026.06 | 54.6 | |
| SF NFNet-F0Protocol=Linear evaluation2023.06 | 54.3 | |
| Audio Transformers#Params=2.3M, Pretrain=true2025.01 | 53.7 | |
| AST (Single)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 51.4 | |
| MaskSpecPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 50.3 | |
| MSM-MAEPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 49 | |
| MAE-ASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 48.2 | |
| Pengimode=Zero-Shot2023.05 | 46.8 | |
| SSASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 46.5 | |
| BYOL-A-V2Protocol=Linear evaluation2023.06 | 44.8 | |
| FSD50K Baseline2023.10 | 43.4 | |
| FSD50K Baseline#Params=0.27M, Pretrain=false2025.01 | 43.4 | |
| VGG-likePre-train Data=-, Training Protocol=Fine-tuning2026.06 | 43.4 | |
| Wav2CLIPPretrain=false2025.01 | 43.1 | |
| PANNs (CNN14)Pre-train Data=AudioSet (Sup.), Training Protocol=Fine-tuning2026.06 | 43.1 | |
| Supervised (Scratch)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 39.8 | |
| AST#Params=87M, Pretrain=false2025.01 | 39.6 | |
| BYOL-APre-train Data=AudioSet, Training Protocol=Fine-tuning2026.06 | 39.5 | |
| Wav2Vec 2.0 (Base)Pre-train Data=LibriSpeech, Training Protocol=Fine-tuning2026.06 | 32 | |
| CLAPmode=Zero-Shot2023.05 | 30.2 | |
| Wav2CLIPmode=Zero-Shot2023.05 | 3 |