Audio Classification on US8K (test)
0.9807R@1 AccuracyEAT (LoRA) + Joint Training
Evaluation Results
| Method | Links | |
|---|---|---|
| EAT (LoRA) + Joint TrainingTraining Protocol=Joint Training, PEFT Strategy=LoRA2026.02 | 0.9807 | |
| PACE2026.02 | 0.9749 | |
| RanPAC (High-Order)2026.02 | 0.9708 | |
| RanPAC (High-Order) w/o FSAFeature Space Alignment=false2026.02 | 0.9649 | |
| ACL (High-Order)2026.02 | 0.9598 | |
| BEATs (iter3+)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 0.911 | |
| PaSST (IN+AS)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 0.901 | |
| AST (Single)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 0.898 | |
| MaskSpecPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 0.896 | |
| MAE-ASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 0.884 | |
| AudioPGPre-train Data=Proc. Audio, Training Protocol=Fine-tuning2026.06 | 0.8817 | |
| MSM-MAEPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 0.881 | |
| M2DProtocol=Linear evaluation2023.06 | 0.876 | |
| PANNs (CNN14)Pre-train Data=AudioSet (Sup.), Training Protocol=Fine-tuning2026.06 | 0.874 | |
| SSASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 0.865 | |
| ATST-ClipProtocol=Linear evaluation2023.06 | 0.858 | |
| ATST-FrameProtocol=Linear evaluation2023.06 | 0.858 | |
| BYOL-APre-train Data=AudioSet, Training Protocol=Fine-tuning2026.06 | 0.848 | |
| HiDe-Prompt2026.02 | 0.7989 | |
| BYOL-A-V2Protocol=Linear evaluation2023.06 | 0.797 | |
| BYOL-AProtocol=Linear evaluation2023.06 | 0.791 | |
| Ishikawa et al. (Shaders1k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 0.783 | |
| HiDe-Adapter2026.02 | 0.7803 | |
| ViT-B (ImageNet SL)Pre-train Data=IN-1k, Training Protocol=Fine-tuning2026.06 | 0.776 | |
| HiDe-LoRA2026.02 | 0.7648 | |
| Supervised (Scratch)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 0.7534 | |
| Audio Flamingozero-shot=true2024.02 | 0.75 | |
| SKMPre-train Data=-, Training Protocol=Fine-tuning2026.06 | 0.74 | |
| CLAPPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.72 | |
| Deshmukh et al., 2023zero-shot=true2024.02 | 0.719 | |
| CyCLAPPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.7182 | |
| CyCLAPPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.7046 | |
| CLAPsPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.7027 | |
| CLAPPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6978 | |
| CLAPPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.6964 | |
| CyCLAPPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6946 | |
| CyCLAPsPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6938 | |
| CyCLAPsPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.6875 | |
| CyCLAPPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.679 | |
| CLAPPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.6776 | |
| CLAPSPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.6742 | |
| CyCLAPSPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6694 | |
| CLAPsPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6649 | |
| CyCLAPSPre-training Dataset=Clotho, Zero-shot=true2023.10 | 0.6598 | |
| CLAPSPre-training Dataset=AudioCaps, Zero-shot=true2023.10 | 0.6414 | |
| LoRASub2026.02 | 0.5781 | |
| EAT (Frozen) + Linear probeEvaluation Protocol=Linear probe2026.02 | 0.4999 | |
| EAT (LoRA) + Linear ProbePEFT Strategy=LoRA, Evaluation Protocol=Linear Probe2026.02 | 0.4968 | |
| EAT (Prompt) + Linear ProbePEFT Strategy=Prompt, Evaluation Protocol=Linear Probe2026.02 | 0.4498 | |
| S-Prompt++2026.02 | 0.4257 | |
| Nearest Class Mean (NCM) w/ FSAFeature Space Alignment=true2026.02 | 0.4244 | |
| DualPrompt2026.02 | 0.424 | |
| EAT (Adapter) + Linear ProbePEFT Strategy=Adapter, Evaluation Protocol=Linear Probe2026.02 | 0.3876 | |
| L2P2026.02 | 0.3875 | |
| Nearest Class Mean (NCM)2026.02 | 0.3609 | |
| Random Guess (1/K)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 0.1 |