Audio Classification on SPC V2
98.7AccuracySupMAM-CLAP
Evaluation Results
| Method | Links | |
|---|---|---|
| SupMAM-CLAPType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 98.7 | |
| M2DType=Baseline, Evaluation Protocol=Fine-tuning2025.03 | 98.4 | |
| M2D-CLAP2025 stage1Type=Audio-Language model, Evaluation Protocol=Fine-tuning2025.03 | 98.4 | |
| M2D-CLAP2025Type=Ablation, Config=Fine-tuned to AudioSet in stage 1.1, Evaluation Protocol=Fine-tuning2025.03 | 98.4 | |
| ATST-C2FType=Reference model, Evaluation Protocol=Fine-tuning2025.03 | 98.4 | |
| BEATSiter3Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98.3 | |
| M2D-CLAP2024 stage1Type=Ablation, Evaluation Protocol=Fine-tuning2025.03 | 98.3 | |
| Audio-MAE#Param=86M, Pre-training Data=AS2024.01 | 98.3 | |
| BEATSiter1#Param=90M, Pre-training Data=AS2024.01 | 98.3 | |
| BEATSiter2#Param=90M, Pre-training Data=AS2024.01 | 98.3 | |
| BEATSiter3#Param=90M, Pre-training Data=AS2024.01 | 98.3 | |
| EAT#Param=88M, Pre-training Data=AS2024.01 | 98.3 | |
| BEATSiter3+Type=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98.1 | |
| ATST-FrameType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98.1 | |
| AST#Param=86M, Pre-training Data=IN2024.01 | 98.1 | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Knowledge Distillation=extra pseudo-labels2024.01 | 98.1 | |
| ATST-ClipType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98 | |
| HTS-ATType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 98 | |
| HTS-AT#Param=31M, Pre-training Data=IN2024.01 | 98 | |
| SS-AST#Param=89M, Pre-training Data=AS+LS2024.01 | 98 | |
| MAE-AST#Param=86M, Pre-training Data=AS+LS2024.01 | 97.9 | |
| MaskSpec#Param=86M, Pre-training Data=AS2024.01 | 97.7 | |
| DTF-AT Full TFType=Audio model, Evaluation Protocol=Fine-tuning2025.03 | 97.68 | |
| CLAP2022Type=Audio-language model, Evaluation Protocol=Fine-tuning2025.03 | 96.8 | |
| Wav2Vec2Evaluation protocol=Linear evaluation2022.10 | 96.6 | |
| PSLA#Param=14M, Pre-training Data=IN2024.01 | 96.3 | |
| M2DAudio enc. fine-tuning on AudioSet=false2025.03 | 96 | |
| M2D# Params=86M, Masking ratio=0.7, Evaluation protocol=Linear evaluation2024.04 | 96 | |
| M2D-CLAP stage1 2024Audio enc. fine-tuning on AudioSet=false2025.03 | 95.8 | |
| M2D-AS# Params=86M, Masking ratio=0.7, Evaluation protocol=Linear evaluation2024.04 | 95.7 | |
| M2D-CLAP stage1 2025Audio enc. fine-tuning on AudioSet=false2025.03 | 95.6 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.62022.10 | 95.4 | |
| ATST-ClipAudio enc. fine-tuning on AudioSet=false2025.03 | 95.1 | |
| ATST BaseEvaluation protocol=Linear evaluation, Variant=Base2022.10 | 95.1 | |
| ATST-BaseEvaluation protocol=Linear evaluation2022.04 | 95.1 | |
| ATST-FrameAudio enc. fine-tuning on AudioSet=false2025.03 | 94.9 | |
| M2D-CLAP2025Audio enc. fine-tuning on AudioSet=true2025.03 | 94.8 | |
| MSM-MAEEvaluation protocol=Linear evaluation2022.10 | 94.5 | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.72022.10 | 94.5 | |
| ATST-SmallEvaluation protocol=Linear evaluation2022.04 | 93.6 | |
| M2DASAudio enc. fine-tuning on AudioSet=true2025.03 | 93.2 | |
| BYOL-AEvaluation protocol=Linear evaluation2022.10 | 93.1 | |
| SF NFNet-F0Evaluation protocol=Linear evaluation2022.10 | 93 | |
| Cacophony (stage 1)Audio enc. fine-tuning on AudioSet=false2025.03 | 92.2 | |
| BYOL-AEvaluation protocol=Linear evaluation2022.04 | 92.2 | |
| DeLoRes-MEvaluation protocol=Linear evaluation2022.10 | 89.7 | |
| BEATsiter3Audio enc. fine-tuning on AudioSet=false2025.03 | 89.4 | |
| CEDAudio enc. fine-tuning on AudioSet=false2025.03 | 89 | |
| MSM-MAE#Param=86M, Pre-training Data=AS2024.01 | 87.3 | |
| BEATsiter3+Audio enc. fine-tuning on AudioSet=true2025.03 | 86.7 | |
| BEATSiter3+# Params=90M, Evaluation protocol=Linear evaluation2024.04 | 86.7 | |
| CLAP2023Audio enc. fine-tuning on AudioSet=true2025.03 | 86.2 | |
| HTS-ATAudio enc. fine-tuning on AudioSet=true2025.03 | 82.1 | |
| HTS-AT# Params=31M, Evaluation protocol=Linear evaluation2024.04 | 82.1 | |
| AST-Fusion#5#12Evaluation protocol=Linear evaluation, Variant=#5#122022.10 | 80.4 | |
| Cacophony (stage 2)Audio enc. fine-tuning on AudioSet=false2025.03 | 76.2 | |
| LAION-CLAPAudio enc. fine-tuning on AudioSet=true2025.03 | 75.9 | |
| WavCapsAudio enc. fine-tuning on AudioSet=true2025.03 | 73.3 | |
| ASTAudio enc. fine-tuning on AudioSet=true2025.03 | 72.6 | |
| AST# Params=86M, Evaluation protocol=Linear evaluation2024.04 | 71.8 | |
| COLAEvaluation protocol=Linear evaluation2022.04 | 62.4 | |
| PANN#Param=81M, Pre-training Data=Not Specified2024.01 | 61.8 | |
| CLAP2022Audio enc. fine-tuning on AudioSet=true2025.03 | 59 | |
| PANNs CNN14Audio enc. fine-tuning on AudioSet=true2025.03 | 51.8 | |
| ConformerXL-P Non-RAEvaluation protocol=Linear evaluation, Variant=Non-RA2022.10 | 50.3 |