Audio Classification on ESC-50
99.25AccuracyCALM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CALMBackbone=Qwen2.5-Omni, Pseudo-Labeling=false2026.02 | 99.25 | — | |
| OmniVec22025.07 | 99.1 | — | |
| SAVsBackbone=Qwen2-Audio, Pseudo-Labeling=false2026.02 | 99 | — | |
| CALMBackbone=Qwen2-Audio, Pseudo-Labeling=false2026.02 | 99 | — | |
| SAVsBackbone=Qwen2.5-Omni, Pseudo-Labeling=false2026.02 | 99 | — | |
| CALMBackbone=Qwen2-Audio, Pseudo-Labeling=true2026.02 | 98.75 | — | |
| CAT#Param=91M, Pre-training Data=AS2026.01 | 98.6 | — | |
| M2D-CLAP2025Type=Ablation, Config=Fine-tuned to AudioSet in stage 1.1, Evaluation Protocol=Fine-tuning2025.03 | 98.5 | — | |
| CALMBackbone=Qwen2.5-Omni, Pseudo-Labeling=true2026.02 | 98.5 | — | |
| OmniVec2025.07 | 98.4 | — | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Supervised Fine-tuning=Included2025.06 | 98.1 | — | |
| BEATS2025.07 | 98.1 | — | |
| BEATSiter3+Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98.1 | — | |
| BEATS_iter3+#Param=90M, Pre-training Data=AS2022.12 | 98.1 | — | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Knowledge Distillation=extra pseudo-labels2024.01 | 98.1 | — | |
| BEATsFine-tuning=true, # Params=90M, Iteration=3+2024.04 | 98.1 | — | |
| BEATs_iter3+#Param=90M, Pre-training Data=AS2026.01 | 98.1 | — | |
| M2D-CLAP2025Audio enc. fine-tuning on AudioSet=true2025.03 | 97.9 | — | |
| M2D-CLAP2025 stage1Type=Audio-Language model, Evaluation Protocol=Fine-tuning2025.03 | 97.8 | — | |
| CLAP2023Audio enc. fine-tuning on AudioSet=true2025.03 | 97.7 | — | |
| SupMAM-CLAPType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 97.6 | — | |
| DTF-AT Full TFType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 97.5 | — | |
| AudioMosaicBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 97.5 | — | |
| M2D-CLAP2024 stage1Type=Ablation, Evaluation Protocol=Fine-tuning2025.03 | 97.4 | — | |
| DyMN-LType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 97.4 | — | |
| Audio-MAE#Param=86M, Pre-training Data=AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 97.4 | — | |
| Audio-MAE (local)Backbone=ViT-B, Pre-training=AS-SSL, AS-SL2022.07 | 97.4 | — | |
| M2D-CLAP#Param=86M, Pre-training Data=TA+AS2026.01 | 97.4 | — | |
| CEDAudio enc. fine-tuning on AudioSet=false2025.03 | 97.3 | — | |
| LAION-CLAPAudio enc. fine-tuning on AudioSet=true2025.03 | 97.3 | — | |
| WavCapsAudio enc. fine-tuning on AudioSet=true2025.03 | 97.2 | — | |
| SSLAM+Probing Protocol=linear2025.09 | 97.17 | — | |
| SSLAM+Probing Protocol=mhca2025.09 | 97.17 | — | |
| AudioCLIPType=Audio-language model, Evaluation Protocol=Fine-tuning2025.03 | 97.15 | — | |
| AudioCLIP (full training)Training On Target=true2021.06 | 97.15 | — | |
| HTS-AT2025.07 | 97 | — | |
| HTS-ATType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 97 | — | |
| Cacophony (stage 2)Audio enc. fine-tuning on AudioSet=false2025.03 | 97 | — | |
| CoLLATAudio enc. fine-tuning on AudioSet=true2025.03 | 97 | — | |
| HTS-AT#Param=31M, Pre-training Data=IN+AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 97 | — | |
| HTS-ATBackbone=Swin-B, Pre-training=IN-SL, AS-SL2022.07 | 97 | — | |
| HTS-ATEvaluation protocol=Fine-tuning2022.10 | 97 | — | |
| HTS-AT#Param=31M, Pre-training Data=IN2024.01 | 97 | — | |
| HTS-ATFine-tuning=true, # Params=31M2024.04 | 97 | — | |
| PaSSTTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 97 | — | |
| HTS-AT#Param=31M, Pre-training Data=IN2026.01 | 97 | — | |
| Absolute SOTAReference=[9]2023.05 | 97 | — | |
| Absolute SOTAAnchor Modality=–2026.04 | 97 | — | |
| Audio-MAE (global)Backbone=ViT-B, Pre-training=AS-SSL, AS-SL2022.07 | 96.9 | — | |
| PaSST#Param=86M, Pre-training Data=IN+AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 96.8 | — | |
| PASSTBackbone=DeiT-B, Pre-training=IN-SL, AS-SL2022.07 | 96.8 | — | |
| PaSSTEvaluation protocol=Fine-tuning2022.10 | 96.8 | — | |
| PassT#Param=86M, Pre-training Data=IN2024.01 | 96.8 | — | |
| PaSSTFine-tuning=true, # Params=86M2024.04 | 96.8 | — | |
| PassT#Param=86M, Pre-training Data=IN2026.01 | 96.8 | — | |
| USAD 2.0 Large+Params=336M, Fine-tuned=true, Teachers=Supervised2026.06 | 96.8 | — | |
| SSLAM+Probing Protocol=protobin2025.09 | 96.75 | — | |
| CLAP2022Type=Audio-language model, Evaluation Protocol=Fine-tuning2025.03 | 96.7 | — | |
| M2DASAudio enc. fine-tuning on AudioSet=true2025.03 | 96.7 | — | |
| AudioCLIP#Param=93M, Pre-training Data=TI+AS, Pre-training Type=Out-of-domain Supervised Pre-Training2022.12 | 96.7 | — | |
| CLAP#Param=190.8M, Pre-training Data=TA, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 96.7 | — | |
| AudioCLIP#Param=93M, Pre-training Data=TI+AS2024.01 | 96.7 | — | |
| AudioCLIP#Param=93M, Pre-training Data=TI+AS2026.01 | 96.7 | — | |
| CLAP#Param=86M, Pre-training Data=TA2026.01 | 96.7 | — | |
| AudioCLIPBackbone=ESResNeXt, Pre-training Data=TI+AS, Pre-training Parameters=134M, Fine-tuning Parameters=93M, Evaluation Protocol=fine-tuning2026.05 | 96.7 | — | |
| EAT+Probing Protocol=linear2025.09 | 96.67 | — | |
| EAT+Probing Protocol=mhca2025.09 | 96.67 | — | |
| EAT+Probing Protocol=protobin2025.09 | 96.67 | — | |
| CEDType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 96.65 | — | |
| AudioCLIP (partial training)Training On Target=true2021.06 | 96.65 | — | |
| XKDtraining_mode=fine-tuning2024.03 | 96.5 | — | |
| SAVsBackbone=Qwen2-Audio, Pseudo-Labeling=true2026.02 | 96.5 | — | |
| USAD 2.0 XLarge+Params=695M, Fine-tuned=true, Teachers=Supervised2026.06 | 96.4 | — | |
| A-JEPA#Param=86M, Pre-training Data=AS2025.06 | 96.3 | — | |
| EAT-M2025.07 | 96.3 | — | |
| M2D-CLAP stage1 2024Audio enc. fine-tuning on AudioSet=false2025.03 | 96.3 | — | |
| EAT-S/MEvaluation protocol=Fine-tuning2022.10 | 96.3 | — | |
| EAT-S/MFine-tuning=true, # Params=25.5M2024.04 | 96.3 | — | |
| A-JEPA#Param=86M, Pre-training Data=AS2026.01 | 96.3 | — | |
| A-JEPABackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=354M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 96.3 | — | |
| SSLAM#Param=88M, Pre-training Data=AS2025.06 | 96.2 | — | |
| SSLAMBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 96.2 | — | |
| SSLAMParams=88M, Fine-tuned=true2026.06 | 96.2 | — | |
| ERANN (2021)Training On Target=true2021.06 | 96.1 | — | |
| ERANN#Param=55M, Pre-training Data=AS, Pre-training Type=In-domain Supervised Pre-Training2022.12 | 96.1 | — | |
| ERANNBackbone=CNN, Pre-training=AS-SL2022.07 | 96.1 | — | |
| BEATs iter3+Training data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 96.1 | — | |
| ASDA#Param=93M, Pre-training Data=AS2026.01 | 96.1 | — | |
| M2DType=Baseline, Evaluation Protocol=Fine-tuning2025.03 | 96 | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.72024.04 | 96 | — | |
| EquiAVtraining_mode=fine-tuning2024.03 | 96 | — | |
| EAT#Param=88M, Pre-training Data=AS2025.06 | 95.9 | — | |
| Audio-Head (ESResNeXt, our training)Training On Target=true2021.06 | 95.9 | — | |
| EAT#Param=88M, Pre-training Data=AS2024.01 | 95.9 | — | |
| HTS-ATTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 95.9 | — | |
| EAT#Param=88M, Pre-training Data=AS2026.01 | 95.9 | — | |
| EATBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 95.9 | — | |
| EATParams=88M, Fine-tuned=true2026.06 | 95.9 | — | |
| M2DFine-tuning=true, # Params=86M, Masking ratio=0.7, Target input strategy=all patches to target2024.04 | 95.8 | — | |
| HTS-ATAudio enc. fine-tuning on AudioSet=true2025.03 | 95.7 | — |