Speech Classification on Speech Commands v1
99AccuracyAudioMosaic
Evaluation Results
| Method | Links | |
|---|---|---|
| AudioMosaicBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 99 | |
| SSLAMBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=93M, Fine-tuning Parameters=88M, Evaluation Protocol=fine-tuning2026.05 | 98.8 | |
| ASiTBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=96M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 98.2 | |
| BEATsiter3Backbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=182M, Fine-tuning Parameters=91M, Evaluation Protocol=fine-tuning2026.05 | 97.7 | |
| A-JEPABackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=354M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 97.7 | |
| Audio-MAEBackbone=ViT-B/16, Pre-training Data=AS, Pre-training Parameters=137M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 96.9 | |
| F3-TokenizerProbing=Frozen representation2026.06 | 96.8 | |
| HuBERTBackbone=ViT-B/16, Pre-training Data=LS, Pre-training Parameters=95M, Fine-tuning Parameters=95M, Evaluation Protocol=linear evaluation2026.05 | 96.3 | |
| Wav2Vec 2.0Backbone=ViT-B/16, Pre-training Data=LS, Pre-training Parameters=95M, Fine-tuning Parameters=95M, Evaluation Protocol=linear evaluation2026.05 | 96.2 | |
| Ming-UProbing=Frozen representation2026.06 | 96.14 | |
| SS-ASTBackbone=ViT-B/16, Pre-training Data=AS+LS, Pre-training Parameters=89M, Fine-tuning Parameters=89M, Evaluation Protocol=fine-tuning2026.05 | 96 | |
| MAE-ASTBackbone=ViT-B/16, Pre-training Data=AS+LS, Pre-training Parameters=174M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 95.8 | |
| ASTBackbone=ViT-B/16, Pre-training Data=IN, Pre-training Parameters=86M, Fine-tuning Parameters=86M, Evaluation Protocol=fine-tuning2026.05 | 95.5 | |
| WhisperProbing=Frozen representation2026.06 | 93.3 | |
| BYOL-ABackbone=CNN, Pre-training Data=AS, Pre-training Parameters=5M, Fine-tuning Parameters=5M, Evaluation Protocol=fine-tuning2026.05 | 91 | |
| w/o RQProbing=Frozen representation2026.06 | 88.8 | |
| w/o LLMProbing=Frozen representation2026.06 | 84.6 | |
| COLABackbone=CNN, Pre-training Data=AS, Pre-training Parameters=5M, Fine-tuning Parameters=5M, Evaluation Protocol=fine-tuning2026.05 | 76.7 | |
| No repr.Probing=Frozen representation2026.06 | 8.7 |