Audio Classification on ESC-50 (test)
98.5AccuracyM2D2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| M2D2type=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 98.5 | — | — | |
| SLAPtype=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 98.2 | — | — | |
| SOTAtype=non-CLAP-based2026.01 | 98.1 | — | — | |
| BEATs (iter3+)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 98.1 | — | — | |
| HTS-ATe2e=false, Pretrained=ImageNet+AudioSet, #Parameters [x10^6]=312022.04 | 97 | — | — | |
| SOTA (Topline)Language=*, Number of Classes=502023.03 | 97 | — | — | |
| PaSST-Se2e=false, Pretrained=ImageNet+AudioSet, #Parameters [x10^6]=85.4, time [msec]=25.42022.04 | 96.8 | — | — | |
| PaSST (IN+AS)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 96.8 | — | — | |
| MS-CLAPtype=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 96.7 | — | — | |
| EAT (LoRA) + Joint TrainingTraining Protocol=Joint Training, PEFT Strategy=LoRA, Backbone=EAT2026.02 | 96.5 | — | — | |
| EAT-Me2e=true, Pretrained=AudioSet, #Parameters [x10^6]=25.5, time [msec]=9.62022.04 | 96.3 | — | — | |
| ERANN-2-5e2e=false, Pretrained=AudioSet, #Parameters [x10^6]=37.92022.04 | 96.1 | — | — | |
| EAT (2024)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 95.9 | — | — | |
| BLATtype=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 95.8 | — | — | |
| OpenBEATs (2025)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 95.8 | — | — | |
| PACELearning Strategy=Statistics-Based CL, Improved FSA=true, MSA=true2026.02 | 95.75 | — | — | |
| ASTBackbone=ViT-B (87.0M), Training Dataset=AS, Training Years=1, Protocol=Linear, Supervised=true2021.03 | 95.6 | — | — | |
| ASTe2e=false, Pretrained=ImageNet+AudioSet, #Parameters [x10^6]=88.1, time [msec]=26.72022.04 | 95.6 | — | — | |
| AST (Single)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 95.6 | — | — | |
| EAT-Se2e=true, Pretrained=AudioSet, #Parameters [x10^6]=5.3, time [msec]=8.32022.04 | 95.25 | — | — | |
| LanguageBindModel Category=MM2025.11 | 94.75 | — | — | |
| Prior work [35]Pre-training=Supervised (S), Evaluation Protocol=Fine-tuning, Training Samples=1,6002021.10 | 94.7 | — | — | |
| PANNe2e=false, Pretrained=AudioSet, #Parameters [x10^6]=812022.04 | 94.7 | — | — | |
| PANNs (CNN14)Pre-train Data=AudioSet (Sup.), Training Protocol=Fine-tuning2026.06 | 94.7 | — | — | |
| CACARAComponents=WC/AC/C, f=0.12025.11 | 94.37 | — | — | |
| WavCapsModel Category=BM2025.11 | 94.25 | — | — | |
| CACARAComponents=WC/AC/C2025.11 | 94.15 | — | — | |
| Prior work [11]Pre-training=Supervised (S), Evaluation Protocol=Shallow classifier, Training Samples=1,6002021.10 | 94.1 | — | — | |
| CACARAComponents=WC/AC/C, f=0.22025.11 | 94 | — | — | |
| LRMethod Type=Baseline, Features=CLAP [18], Solver=L-BFGS2026.03 | 94 | — | — | |
| MSM-MAEPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 94 | — | — | |
| CLAP (Microsoft)Model Category=BM2025.11 | 93.85 | — | — | |
| BraVeConfig=V+A, Backbone=TSM-50 (23.5M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 93 | — | — | |
| RanPAC (High-Order) w/o FSALearning Strategy=Statistics-Based CL, Feature Space Alignment=false2026.02 | 92.5 | — | — | |
| AemNet-DW WM1.0e2e=true, Pretrained=AudioSet, #Parameters [x10^6]=1.22022.04 | 92.32 | — | — | |
| BraVeConfig=V+FA, Backbone=R(2+1)D-50 (46.9M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Linear2021.03 | 92.3 | — | — | |
| RanPAC (High-Order)Learning Strategy=Statistics-Based CL2026.02 | 92.25 | — | — | |
| EAT-Se2e=true, Pretrained=none, #Parameters [x10^6]=5.3, time [msec]=8.32022.04 | 92.15 | — | — | |
| BraVeConfig=V+FA, Backbone=TSM-50 (23.5M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Linear2021.03 | 92 | — | — | |
| Pengimode=Zero-Shot2023.05 | 92 | — | — | |
| BraVeConfig=V+A, Backbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 91.9 | — | — | |
| BraVeConfig=V+FA, Backbone=TSM-50x2 (93.9M), Training Dataset=AS, Training Years=1, Training Modalities=VFA, Protocol=Linear2021.03 | 91.7 | — | — | |
| CACARAComponents=ASC/AA/WC/AC/C, f=0.22025.11 | 91.35 | — | — | |
| SepTrtrained_from=scratch2022.03 | 91.13 | — | — | |
| LAIONmode=Zero-Shot2023.05 | 91 | — | — | |
| MaskSpecPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 90.7 | — | — | |
| AudioPGPre-train Data=Proc. Audio, Training Protocol=Fine-tuning2026.06 | 90.6 | — | — | |
| ACL (High-Order)Learning Strategy=Statistics-Based CL2026.02 | 90 | — | — | |
| MAE-ASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 90 | — | — | |
| CACARAComponents=ASC/AA/WC/AC/C, f=0.12025.11 | 89.97 | — | — | |
| CACARAComponents=AA/WC/AC/C2025.11 | 89.95 | — | — | |
| EfficientNettrained_from=scratch2022.03 | 89.5 | — | — | |
| AVIDBackbone=R(2+1)D-50 (46.9M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 89.2 | — | — | |
| ERANN-1-3e2e=false, Pretrained=none, #Parameters [x10^6]=13.62022.04 | 89.2 | — | — | |
| SSAST 400Masked Patches=400, Pretraining=Self-Supervised2021.10 | 88.8 | — | — | |
| SSASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 88.8 | — | — | |
| HiDe-LoRAPEFT Strategy=LoRA, Learning Strategy=PEFT-Based CL2026.02 | 88.75 | — | — | |
| AST-IM + KDPretraining=ImageNet + Knowledge Distillation2021.10 | 88.7 | — | — | |
| ViTtrained_from=scratch2022.03 | 88.7 | — | — | |
| AST-SPre-train Data=IN, Training Protocol=Fine-tuning2026.06 | 88.7 | — | — | |
| GDTBackbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 88.5 | — | — | |
| MLLM PredictionMethod Type=Baseline, Backbone=gemini-3-f-p, Trials=10, Sampling Temperature=1.0, Evaluation Protocol=direct zero-shot prediction2026.03 | 88.35 | 0.88 | — | |
| cf_LArchitecture=SS Conformer, Model Scale=Large, Pre-training=Self-supervised (SS), Evaluation Protocol=Fine-tuning, Training Samples=1,6002021.10 | 88 | — | — | |
| Ishikawa et al. (Shaders1k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 87.3 | — | — | |
| Adaptive Attribute Discovery with MLLMsMethod Type=Proposed, Backbone=gemini-3-f-p, Trials=10, Sampling Temperature=1.0, q=10, T=10, k=10, Weak Classifier=decision stump2026.03 | 87.15 | 1.49 | -1.2 | |
| ViT-B (ImageNet SL)Pre-train Data=IN-1k, Training Protocol=Fine-tuning2026.06 | 87 | — | — | |
| AST-AudioSetPretraining=Supervised AudioSet2021.10 | 86.8 | — | — | |
| SSAST 250Masked Patches=250, Pretraining=Self-Supervised2021.10 | 86.7 | — | — | |
| RBMtrained_from=scratch2022.03 | 86.5 | — | — | |
| Prior work [28]Pre-training=Self-supervised (SS), Evaluation Protocol=Shallow classifier, Training Samples=1,6002021.10 | 86.3 | — | — | |
| MMVBackbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 85.6 | — | — | |
| XDCBackbone=R(2+1)D-18 (33.3M), Training Dataset=IG65M, Training Years=21, Training Modalities=VA, Protocol=Linear2021.03 | 85.4 | — | — | |
| EnvNet-v2e2e=true, Pretrained=none, #Parameters [x10^6]=101, time [msec]=2.72022.04 | 84.9 | — | — | |
| XDCBackbone=R(2+1)D-18 (33.3M), Training Dataset=AS, Training Years=1, Training Modalities=VA, Protocol=Linear2021.03 | 84.8 | — | — | |
| BYOL-APre-train Data=AudioSet, Training Protocol=Fine-tuning2026.06 | 84.2 | — | — | |
| HiDe-PromptPEFT Strategy=Prompt, Learning Strategy=PEFT-Based CL2026.02 | 83.75 | — | — | |
| FDSL (exF-21k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 83.7 | — | — | |
| ESResNet-Atte2e=false, Pretrained=none, #Parameters [x10^6]=32.6, time [msec]=11.32022.04 | 83.15 | — | — | |
| CLAP (LAION)Model Category=BM2025.11 | 83.1 | — | — | |
| HiDe-AdapterPEFT Strategy=Adapter, Learning Strategy=PEFT-Based CL2026.02 | 82.75 | — | — | |
| CLAPmode=Zero-Shot2023.05 | 82.6 | — | — | |
| CACARAComponents=ASC/AA/WC/AC/C2025.11 | 82.45 | — | — | |
| AemNet WM1.0e2e=true, Pretrained=none, #Parameters [x10^6]=52022.04 | 81.5 | — | — | |
| cf_SArchitecture=SS Conformer, Model Scale=Small, Pre-training=Self-supervised (SS), Evaluation Protocol=Fine-tuning, Training Samples=1,6002021.10 | 80.7 | — | — | |
| MAE (VA-1k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 79.5 | — | — | |
| VASTModel Category=MM2025.11 | 76.8 | — | — | |
| Wav2Vec 2.0 (Base)Pre-train Data=LibriSpeech, Training Protocol=Fine-tuning2026.06 | 75.5 | — | — | |
| AudioCLIPmode=Zero-Shot2023.05 | 69.4 | — | — | |
| FDSL (VA-21k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 68.1 | — | — | |
| ImageBindModel Category=MM2025.11 | 64.15 | — | — | |
| EAT (LoRA) + Linear ProbePEFT Strategy=LoRA, Evaluation Protocol=Linear Probe, Backbone=EAT2026.02 | 64 | — | — | |
| EAT (Adapter) + Linear ProbePEFT Strategy=Adapter, Evaluation Protocol=Linear Probe, Backbone=EAT2026.02 | 59.25 | — | — | |
| EAT (Prompt) + Linear ProbePEFT Strategy=Prompt, Evaluation Protocol=Linear Probe, Backbone=EAT2026.02 | 58.75 | — | — | |
| LoRASubPEFT Strategy=LoRA, Learning Strategy=PEFT-Based CL2026.02 | 57.5 | — | — | |
| DualPromptLearning Strategy=PEFT-Based CL2026.02 | 57 | — | — | |
| S-Prompt++Learning Strategy=PEFT-Based CL2026.02 | 55 | — | — | |
| Supervised (Scratch)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 54 | — | — | |
| Nearest Class Mean (NCM) w/ FSALearning Strategy=Statistics-Based CL, Feature Space Alignment=true2026.02 | 49 | — | — | |
| MFCC + Random ForestPre-train Data=-, Training Protocol=Fine-tuning2026.06 | 44.3 | — | — | |
| AST-ScratchTraining=From scratch2021.10 | 41.9 | — | — |