Audio Classification on Urbansound8K
97.5AccuracyConformerXL-P Non-RA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ConformerXL-P Non-RAEvaluation protocol=Linear evaluation, Variant=Non-RA2022.10 | 97.5 | — | — | — | |
| ERANN-2-6e2e=false, Params=54.5 x 10^6, Training Protocol=Fine-tune2021.06 | 90.8 | — | — | — | |
| ERANN-1-6e2e=false, Params=54.1 x 10^6, Training Protocol=Fine-tune2021.06 | 90.6 | — | — | — | |
| ERANN-0-6e2e=false, Params=54.0 x 10^6, Training Protocol=Fine-tune2021.06 | 90.4 | — | — | — | |
| ERANN-2-5e2e=false, Params=37.9 x 10^6, Training Protocol=Fine-tune2021.06 | 90.3 | — | — | — | |
| AudioCLIP (full training)Training On Target=true2021.06 | 90.07 | — | — | — | |
| AudioCLIP (partial training)Training On Target=true2021.06 | 89.95 | — | — | — | |
| M2D-AS# Params=86M, Masking ratio=0.7, Evaluation protocol=Linear evaluation2024.04 | 89.8 | — | — | — | |
| M2D-CLAP2025Audio enc. fine-tuning on AudioSet=true2025.03 | 89.7 | — | — | — | |
| ERANN-2-4e2e=false, Params=24.2 x 10^6, Training Protocol=Fine-tune2021.06 | 89.7 | — | — | — | |
| AaPE#Params=87M, Protocol=Linear Probing2025.12 | 89.7 | — | — | — | |
| M2D-CLAP stage1 2025Audio enc. fine-tuning on AudioSet=false2025.03 | 89.5 | — | — | — | |
| BEATs iter3+Training data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 89.5 | — | — | — | |
| Audio-Head (ESResNeXt, our training)Training On Target=true2021.06 | 89.49 | — | — | — | |
| MATPACAudio enc. fine-tuning on AudioSet=false2025.03 | 89.4 | — | — | — | |
| MATPACTraining data=AS, nr,epoch=10, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 89.4 | — | — | — | |
| MATPAC/n10#Params=86M, Protocol=Linear Probing2025.12 | 89.4 | — | — | — | |
| M2DASAudio enc. fine-tuning on AudioSet=true2025.03 | 89.3 | — | — | — | |
| ESResNeXt (2021)Training On Target=true2021.06 | 89.14 | — | — | — | |
| ESResNeXte2e=false, Params=30.0 x 10^6, Training Protocol=Fine-tune2021.06 | 89.1 | — | — | — | |
| PaSSTTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 89.1 | — | — | — | |
| CoLLATAudio enc. fine-tuning on AudioSet=true2025.03 | 89 | — | — | — | |
| Proposed 1D CNN GammaRepresentation=1D, # of Parameters=550 k2019.04 | 89 | — | — | — | |
| M2D-CLAP stage1 2024Audio enc. fine-tuning on AudioSet=false2025.03 | 88.8 | — | — | — | |
| CLAP2023Audio enc. fine-tuning on AudioSet=true2025.03 | 88.4 | — | — | — | |
| MATPACTraining data=AS, nr,epoch=20, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 88 | — | — | — | |
| CEDAudio enc. fine-tuning on AudioSet=false2025.03 | 87.8 | — | — | — | |
| BEATsiter3+Audio enc. fine-tuning on AudioSet=true2025.03 | 87.6 | — | — | — | |
| M2DAudio enc. fine-tuning on AudioSet=false2025.03 | 87.6 | — | — | — | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.62022.10 | 87.6 | — | — | — | |
| BEATSiter3+# Params=90M, Evaluation protocol=Linear evaluation2024.04 | 87.6 | — | — | — | |
| M2D# Params=86M, Masking ratio=0.7, Evaluation protocol=Linear evaluation2024.04 | 87.6 | — | — | — | |
| M2DNumber of Parameters=86M, Masking ratio=0.7, Target Feeding=masked patches, Linear Evaluation=true2024.04 | 87.6 | — | — | — | |
| BEATSiter3+Number of Parameters=90M, Linear Evaluation=true2024.04 | 87.6 | — | — | — | |
| M2D/0.7#Params=86M, Protocol=Linear Probing2025.12 | 87.6 | — | — | — | |
| MATPAC w/o ClassificationTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 87.5 | — | — | — | |
| DenseNet-201 x 5, ensemble (2020)Training On Target=true2021.06 | 87.42 | — | — | — | |
| MSM-MAENumber of Parameters=86M, Masking ratio=0.75, Linear Evaluation=true2024.04 | 87.4 | — | — | — | |
| M2DNumber of Parameters=86M, Masking ratio=0.6, Target Feeding=masked patches, Linear Evaluation=true2024.04 | 87.2 | — | — | — | |
| M2DEvaluation protocol=Linear evaluation, Masking ratio=0.72022.10 | 87.1 | — | — | — | |
| M2Dratio=0.7, Training data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 87.1 | — | — | — | |
| Proposed 1D CNN RandRepresentation=1D, # of Parameters=256 k2019.04 | 87 | — | — | — | |
| M2DNumber of Parameters=86M, Masking ratio=0.6, Target Feeding=all patches, Linear Evaluation=true2024.04 | 87 | — | — | — | |
| LAION-CLAPAudio enc. fine-tuning on AudioSet=true2025.03 | 86.9 | — | — | — | |
| M2DNumber of Parameters=86M, Masking ratio=0.7, Target Feeding=all patches, Linear Evaluation=true2024.04 | 86.7 | — | — | — | |
| MSM-MAEEvaluation protocol=Linear evaluation2022.10 | 86.3 | — | — | — | |
| ATST-ClipAudio enc. fine-tuning on AudioSet=false2025.03 | 85.8 | — | — | — | |
| ATST-FrameAudio enc. fine-tuning on AudioSet=false2025.03 | 85.8 | — | — | — | |
| ATST BaseNumber of Parameters=86M, Linear Evaluation=true2024.04 | 85.8 | — | — | — | |
| ATST-ClipTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 85.8 | — | — | — | |
| ATST-FrameTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 85.8 | — | — | — | |
| ATST-Frame#Params=86M, Protocol=Linear Probing2025.12 | 85.8 | — | — | — | |
| AST-Fusion#5#12Evaluation protocol=Linear evaluation, Variant=#5#122022.10 | 85.5 | — | — | — | |
| AST# Params=86M, Evaluation protocol=Linear evaluation2024.04 | 85.5 | — | — | — | |
| ASTNumber of Parameters=86M, Linear Evaluation=true2024.04 | 85.5 | — | — | — | |
| AST-Fusion#5#12Number of Parameters=86M, Linear Evaluation=true2024.04 | 85.5 | — | — | — | |
| ESResNet (2020)Training On Target=true2021.06 | 85.42 | — | — | — | |
| ASTAudio enc. fine-tuning on AudioSet=true2025.03 | 85.4 | — | — | — | |
| ESResNete2e=false, Params=30.6 x 10^6, Training Protocol=Fine-tune2021.06 | 85.4 | — | — | — | |
| BEATS iter3Training data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 85.4 | — | — | — | |
| HTS-ATTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 85.3 | — | — | — | |
| Proposed Modelfeatures=spectrogram2026.03 | 85.26 | 69 | 63 | 61 | |
| FineLAPEvaluation Protocol=Zero-shot, Template=The sound of {}2026.04 | 84.9 | — | — | — | |
| BEATsiter3Audio enc. fine-tuning on AudioSet=false2025.03 | 84.8 | — | — | — | |
| BEATSiter3Number of Parameters=90M, Linear Evaluation=true2024.04 | 84.8 | — | — | — | |
| BEATs_iter3#Params=90M, Protocol=Linear Probing2025.12 | 84.8 | — | — | — | |
| FACEfeatures=spectrogram2026.03 | 84.54 | 71 | 57 | 59 | |
| CLAP2022Audio enc. fine-tuning on AudioSet=true2025.03 | 84.2 | — | — | — | |
| ATST BaseEvaluation protocol=Linear evaluation, Variant=Base2022.10 | 84.1 | — | — | — | |
| ATST-BaseEvaluation protocol=Linear evaluation2022.04 | 84.1 | — | — | — | |
| HTS-ATAudio enc. fine-tuning on AudioSet=true2025.03 | 83.8 | — | — | — | |
| HTS-AT# Params=31M, Evaluation protocol=Linear evaluation2024.04 | 83.8 | — | — | — | |
| HTS-ATNumber of Parameters=31M, Linear Evaluation=true2024.04 | 83.8 | — | — | — | |
| MGA-CLAPEvaluation Protocol=Zero-shot, Template=The sound of {}2026.04 | 83.7 | — | — | — | |
| AemNet-DWe2e=true, Params=0.9 x 10^6, Training Protocol=Fine-tune2021.06 | 83.5 | — | — | — | |
| ERANN-1-4e2e=false, Params=24.1 x 10^6, Training Protocol=Scratch2021.06 | 83.5 | — | — | — | |
| PANNsfeatures=spectrogram2026.03 | 83.26 | 63 | 61 | 66 | |
| ERANN-1-3e2e=false, Params=13.5 x 10^6, Training Protocol=Scratch2021.06 | 82.9 | — | — | — | |
| ESResNete2e=false, Params=30.6 x 10^6, Training Protocol=Scratch2021.06 | 82.8 | — | — | — | |
| DeLoRes-MEvaluation protocol=Linear evaluation2022.10 | 82.7 | — | — | — | |
| DeLoRes-MNumber of Parameters=5.3M, Linear Evaluation=true2024.04 | 82.7 | — | — | — | |
| ERANN-0-4e2e=false, Params=24.0 x 10^6, Training Protocol=Scratch2021.06 | 82.6 | — | — | — | |
| ERANN-2-4e2e=false, Params=24.2 x 10^6, Training Protocol=Scratch2021.06 | 82.6 | — | — | — | |
| ERANN-0-3e2e=false, Params=13.5 x 10^6, Training Protocol=Scratch2021.06 | 82.3 | — | — | — | |
| M2D-CLAPEvaluation Protocol=Zero-shot, Template=The sound of {}2026.04 | 82.3 | — | — | — | |
| ATST-SmallEvaluation protocol=Linear evaluation2022.04 | 82 | — | — | — | |
| PANNs CNN14Audio enc. fine-tuning on AudioSet=true2025.03 | 81.9 | — | — | — | |
| ERANN-2-5e2e=false, Params=37.9 x 10^6, Training Protocol=Scratch2021.06 | 81.3 | — | — | — | |
| MAE-ASTTraining data=AS+LS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 81.3 | — | — | — | |
| HTSAT-BERTEvaluation Protocol=Zero-shot, Template=The sound of {}2026.04 | 80.6 | — | — | — | |
| BYOL-AEvaluation protocol=Linear evaluation2022.10 | 79.7 | — | — | — | |
| BYOL-ANumber of Parameters=5.3M, Linear Evaluation=true2024.04 | 79.7 | — | — | — | |
| BYOL-AEvaluation protocol=Linear evaluation2022.04 | 79.1 | — | — | — | |
| SB-CNNRepresentation=2D, Data Augmentation=true, # of Parameters=241 k2019.04 | 79 | — | — | — | |
| SB-CNN (2017)Training On Target=true2021.06 | 79 | — | — | — | |
| Laion-CLAPzero-shot=true, multimodal query=true2024.10 | 78.39 | — | — | — | |
| EnvNet-v2e2e=true, Params=101.1 x 10^6, Training Protocol=Scratch2021.06 | 78.3 | — | — | — | |
| EnvNet-v2Representation=1D, # of Parameters=101 M2019.04 | 78 | — | — | — | |
| Dataset β with pruningsetting=common weighting vector, pruning=true2026.01 | 77.4 | — | — | — | |
| Dataset βsetting=common weighting vector, NS=size of dataset2026.01 | 77.3 | — | — | — |