Audio Classification on Speech Commands V2 (test)
98.9AccuracyASiT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASiTParameters=86M, Fine-tuned=true2025.12 | 98.9 | — | |
| SOTAtype=non-CLAP-based2026.01 | 98.7 | — | |
| SepTrtrained_from=scratch2022.03 | 98.51 | — | |
| SLAPtype=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 98.5 | — | |
| M2D/0.7Parameters=86M, Fine-tuned=true2025.12 | 98.4 | — | |
| M2D2type=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 98.4 | — | |
| Audio-MAEParameters=86M, Fine-tuned=true2025.12 | 98.3 | — | |
| BEATs_iter3Parameters=90M, Fine-tuned=true2025.12 | 98.3 | — | |
| EATParameters=88M, Fine-tuned=true2025.12 | 98.3 | — | |
| ASDAParameters=93M, Fine-tuned=true2025.12 | 98.3 | — | |
| EAT (2024)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 98.3 | — | |
| ESCBits=8, Model Architecture=AST2026.03 | 98.15 | 99.96 | |
| Full precisionBits=32, Model Architecture=AST2026.03 | 98.13 | 99.98 | |
| MaxBits=8, Model Architecture=AST2026.03 | 98.12 | 99.98 | |
| ViTtrained_from=scratch2022.03 | 98.11 | — | |
| AST-SPre-train Data=IN, Training Protocol=Fine-tuning2026.06 | 98.11 | — | |
| ATST-FrameParameters=86M, Fine-tuned=true2025.12 | 98.1 | — | |
| SSLAMParameters=88M, Fine-tuned=true2025.12 | 98.1 | — | |
| AST (Single)Pre-train Data=IN+AS, Training Protocol=Fine-tuning2026.06 | 98.1 | — | |
| BEATs (iter3+)Pre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 98.1 | — | |
| MSEBits=8, Model Architecture=AST2026.03 | 98.07 | 99.96 | |
| PercentileBits=8, Model Architecture=AST2026.03 | 98.06 | 99.95 | |
| SSASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 98 | — | |
| AaPEParameters=87M, Fine-tuned=true2025.12 | 97.9 | — | |
| MaskSpecParameters=86M, Fine-tuned=true2025.12 | 97.7 | — | |
| MaskSpecPre-train Data=AS, Training Protocol=Fine-tuning2026.06 | 97.7 | — | |
| MatchboxNettrained_from=scratch2022.03 | 97.4 | — | |
| AudioPGPre-train Data=Proc. Audio, Training Protocol=Fine-tuning2026.06 | 97.03 | — | |
| PANNs (CNN14)Pre-train Data=AudioSet (Sup.), Training Protocol=Fine-tuning2026.06 | 96.9 | — | |
| MS-CLAPtype=CLAP-based, protocol=linear classification layer fine-tuning2026.01 | 96.8 | — | |
| Ishikawa et al. (Shaders1k)Pre-train Data=Syn. Images, Training Protocol=Fine-tuning2026.06 | 96.8 | — | |
| ESCBits=4, Model Architecture=AST2026.03 | 96.41 | 99.94 | |
| Supervised (Scratch)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 96.3 | — | |
| Wav2Vec 2.0 (Base)Pre-train Data=LibriSpeech, Training Protocol=Fine-tuning2026.06 | 96.2 | — | |
| MSEBits=4, Model Architecture=AST2026.03 | 96.03 | 99.91 | |
| EAT (LoRA) + Joint TrainingTraining Protocol=Joint Training2026.02 | 95.91 | — | |
| MAE-ASTPre-train Data=AS+LS, Training Protocol=Fine-tuning2026.06 | 95.8 | — | |
| PercentileBits=4, Model Architecture=AST2026.03 | 95.51 | 99.9 | |
| PACE2026.02 | 91.87 | — | |
| RanPAC (High-Order)2026.02 | 90.53 | — | |
| EntropyBits=8, Model Architecture=AST2026.03 | 90.09 | 99.65 | |
| RanPAC (High-Order) w/o FSAFeature Space Alignment=false2026.02 | 81.22 | — | |
| ACL (High-Order)2026.02 | 80.29 | — | |
| EntropyBits=4, Model Architecture=AST2026.03 | 63.98 | 96.15 | |
| Nearest Class Mean (NCM) w/ FSAFeature Space Alignment=true2026.02 | 57.6 | — | |
| EAT (Adapter) + Linear ProbePEFT Strategy=Adapter2026.02 | 55.33 | — | |
| EAT (Prompt) + Linear ProbePEFT Strategy=Prompt2026.02 | 41.54 | — | |
| HiDe-Prompt2026.02 | 40.1 | — | |
| LoRASub2026.02 | 34.24 | — | |
| HiDe-Adapter2026.02 | 33.71 | — | |
| HiDe-LoRA2026.02 | 33.66 | — | |
| EAT (Frozen) + Linear probeEvaluation Protocol=Linear probe2026.02 | 32.84 | — | |
| EAT (LoRA) + Linear ProbePEFT Strategy=LoRA2026.02 | 30.56 | — | |
| S-Prompt++2026.02 | 27.23 | — | |
| DualPrompt2026.02 | 21.92 | — | |
| L2P2026.02 | 14.7 | — | |
| Nearest Class Mean (NCM)2026.02 | 9.3 | — | |
| MaxBits=4, Model Architecture=AST2026.03 | 3.71 | 50 | |
| Random Guess (1/K)Pre-train Data=-, Training Protocol=Fine-tuning2026.06 | 2.86 | — |