Environmental sound classification on FSD50K
69.7mAPONE-PEACE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ONE-PEACEEvaluation Protocol=Fine-Tuning2023.05 | 69.7 | — | |
| SOTA [134]Evaluation Protocol=Fine-Tuning2023.05 | 65.6 | — | |
| MTC (AudioSet)Label=Tag, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 65.6 | — | |
| ATST-C2F# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 65.5 | — | |
| PassT# Param=86M, Pre-training data=AS2023.06 | 65.3 | — | |
| ATST-F2C# Param=86M, Pre-training data=AS, knowledge distillation=true2023.06 | 64.6 | — | |
| ATST-Clip# Param=86M, Pre-training data=AS2023.06 | 63.4 | — | |
| KD-AST# Param=86M, Pre-training data=AS2023.06 | 62.9 | — | |
| ATST-Frame# Param=86M, Pre-training data=AS2023.06 | 61.8 | — | |
| PaSSTTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 61.3 | — | |
| BEATs iter3+Training data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 60.6 | — | |
| HTS-ATTraining data=AS, Learning type=Supervised, Evaluation protocol=Linear evaluation2025.02 | 59.4 | — | |
| CLAPEvaluation Protocol=Fine-Tuning2023.05 | 58.6 | — | |
| XKDPretrain=AS, Modality=Video + Audio, Evaluation Protocol=Fine-tuning2022.11 | 58.5 | — | |
| ATST-ClipTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 58.5 | — | |
| PaSST(SL)Pretrain=AS+IN, Modality=Audio + Image, Evaluation Protocol=Fine-tuning2022.11 | 58.4 | — | |
| BEATsLabel=-, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 56.5 | — | |
| DASSNR=20 dB, Backbone=larger_clap2026.06 | 56.38 | 1.5 | |
| PSLAPretrain=AS, Modality=Audio, Evaluation Protocol=Fine-tuning2022.11 | 55.8 | — | |
| PSLA# Param=14M, Pre-training data=AS2023.06 | 55.4 | — | |
| MATPACTraining data=AS, nr,epoch=10, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 55.2 | — | |
| ATST-FrameTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 55.1 | — | |
| BaseSNR=20 dB, Backbone=larger_clap2026.06 | 54.88 | — | |
| ZS-T-gSNR=20 dB, Backbone=larger_clap2026.06 | 54.88 | — | |
| ZS-T-mSNR=20 dB, Backbone=larger_clap2026.06 | 54.88 | — | |
| ZS-A-mSNR=20 dB, Backbone=larger_clap2026.06 | 54.88 | — | |
| MATPACTraining data=AS, nr,epoch=20, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 54.8 | — | |
| MATPAC w/o ClassificationTraining data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 54.4 | — | |
| XKDPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Fine-tuning2022.11 | 54.1 | — | |
| XKD-MATSPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Fine-tuning2022.11 | 53.8 | — | |
| Aud. T-formerPretrain=AS, Modality=Audio, Evaluation Protocol=Fine-tuning2022.11 | 53.7 | — | |
| M2Dratio=0.7, Training data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 52.8 | — | |
| XKD-MASPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Fine-tuning2022.11 | 52.3 | — | |
| Hybrid BYOL-S/CvT2022.06 | 52 | — | |
| XKDPretrain=AS, Modality=Video + Audio, Evaluation Protocol=Linear2022.11 | 51.5 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=1:12022.06 | 50.2 | — | |
| BYOL-Swindow size (s)=0.952022.06 | 50 | — | |
| BYOL-S2022.06 | 49.9 | — | |
| BYOL-Swindow size (s)=1.4252022.06 | 49.9 | — | |
| BYOL-Swindow size (s)=22022.06 | 49.6 | — | |
| BYOL-Swindow size (s)=0.52022.06 | 49.5 | — | |
| BYOL-S++2022.06 | 49.4 | — | |
| Contrastive-scratchLabel=Caption, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 49.3 | — | |
| SAM-2.7Br=256, Conn.=(a), Experiment=E62025.09 | 49.2 | — | |
| SAM-2.7Br=256, Conn.=(c), Ablation=4.2, Experiment=E152025.09 | 49 | — | |
| BYOL-A2022.06 | 48.9 | — | |
| Hybrid BYOL-S/Default2022.06 | 48.9 | — | |
| SAM-2.7Br=256, Conn.=(b), Ablation=4.2, Experiment=E142025.09 | 48.9 | — | |
| DASSNR=10 dB, Backbone=larger_clap2026.06 | 48.81 | 1.69 | |
| SAM-780Mr=256, Conn.=(a), Experiment=E52025.09 | 48.8 | — | |
| TGAPSNR=20 dB, Backbone=larger_clap2026.06 | 48.76 | — | |
| TGAP-ASNR=20 dB, Backbone=larger_clap2026.06 | 48.76 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=4:12022.06 | 48.7 | — | |
| SAM-780Mr=256, Conn.=(b), Ablation=4.2, Experiment=E122025.09 | 48.6 | — | |
| Multi-Task (Ours)Label=Tag*, Caption*, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 48.5 | — | |
| SAM-2.7Br=8, Conn.=(a), Experiment=E32025.09 | 48.4 | — | |
| SAM-780Mr=256, Conn.=(c), Ablation=4.2, Experiment=E132025.09 | 48.4 | — | |
| BYOL-Sencoder=CvT2022.06 | 48.3 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=2:12022.06 | 48.3 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=3:22022.06 | 47.9 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=2:32022.06 | 47.8 | — | |
| GAMA-7Br=8, Conn.=QFormer2025.09 | 47.8 | — | |
| ssLALM-2.8Br=8, Conn.=Linear2025.09 | 47.7 | — | |
| BaseSNR=10 dB, Backbone=larger_clap2026.06 | 47.12 | — | |
| ZS-T-gSNR=10 dB, Backbone=larger_clap2026.06 | 47.12 | — | |
| ZS-T-mSNR=10 dB, Backbone=larger_clap2026.06 | 47.12 | — | |
| ZS-A-mSNR=10 dB, Backbone=larger_clap2026.06 | 47.12 | — | |
| SAM-130Mr=8, Conn.=(a), Experiment=E12025.09 | 47 | — | |
| SAM-780Mr=8, Conn.=(a), Experiment=E22025.09 | 47 | — | |
| Pengi2023.05 | 46.76 | — | |
| BEATS iter3Training data=AS, Learning type=SSL, Evaluation protocol=Linear evaluation2025.02 | 46.7 | — | |
| SAM-130Mr=256, Conn.=(a), Experiment=E42025.09 | 46.7 | — | |
| SAM-2.7Br=256, Conn.=(a), Ablation=4.3, Experiment=E182025.09 | 46.7 | — | |
| SAM-780Mr=256, Conn.=(a), Ablation=4.3, Experiment=E172025.09 | 46.6 | — | |
| DASSNR=8 dB, Backbone=larger_clap2026.06 | 46.57 | 1.74 | |
| LTU-7Br=8, Conn.=Linear2025.09 | 46.3 | — | |
| SAM-130Mr=256, Conn.=(b), Ablation=4.2, Experiment=E102025.09 | 46.3 | — | |
| SAM-130Mr=256, Conn.=(c), Ablation=4.2, Experiment=E112025.09 | 46.3 | — | |
| LAION-CLAPEvaluation Protocol=Fine-Tuning2023.05 | 46.2 | — | |
| Hybrid BYOL-S/CvTalpha:beta ratio=1:22022.06 | 46.1 | — | |
| MTC (Ours-UTS)Label=Tag*, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 45.9 | — | |
| XKDPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Linear2022.11 | 45.8 | — | |
| SAM-780Mr=256, Conn.=(a), Ablation=4.1, Experiment=E82025.09 | 45 | — | |
| BaseSNR=8 dB, Backbone=larger_clap2026.06 | 44.83 | — | |
| ZS-T-gSNR=8 dB, Backbone=larger_clap2026.06 | 44.83 | — | |
| ZS-T-mSNR=8 dB, Backbone=larger_clap2026.06 | 44.83 | — | |
| ZS-A-mSNR=8 dB, Backbone=larger_clap2026.06 | 44.83 | — | |
| BYOL-APretrain=AS, Modality=Audio, Evaluation Protocol=Linear2022.11 | 44.8 | — | |
| SAM-2.7Br=256, Conn.=(a), Ablation=4.1, Experiment=E92025.09 | 44.5 | — | |
| Contrastive-scratch (Ours)Label=Caption*, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 44.5 | — | |
| DASSNR=6 dB, Backbone=larger_clap2026.06 | 44.38 | 1.71 | |
| BYOL-S/CvT + OS2022.06 | 44.2 | — | |
| SAM-130Mr=256, Conn.=(a), Ablation=4.3, Experiment=E162025.09 | 44 | — | |
| Captioning-scratch (Ours)Label=Caption*, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 43.9 | — | |
| XKD-MATSPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Linear2022.11 | 43.4 | — | |
| BYOL-Sencoder=Resnetish-342022.06 | 43.3 | — | |
| PAR (Ours-UTS)Label=Tag Sequence*, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 43.3 | — | |
| Wav2CLIPEvaluation Protocol=Fine-Tuning2023.05 | 43.1 | — | |
| XKD-MASPretrain=K400, Modality=Video + Audio, Evaluation Protocol=Linear2022.11 | 43 | — | |
| Captioning-scratchLabel=Caption, Evaluation Protocol=linear probing, Pooling Strategy=mean-pooling2026.03 | 43 | — |