Keyword Spotting on Speech Commands KS1 v1
98.8AccuracySSLAM
Evaluation Results
| Method | Links | |
|---|---|---|
| SSLAM#Param=88M, Pre-training Data=AS2025.06 | 98.8 | |
| ASIT#Param=86M, Pre-training Data=AS2025.06 | 98.2 | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Supervised Fine-tuning=Included2025.06 | 98.1 | |
| BEATSiter3#Param=90M, Pre-training Data=AS2025.06 | 97.7 | |
| A-JEPA#Param=86M, Pre-training Data=AS2025.06 | 97.7 | |
| Audio-MAE (global)Backbone=ViT-B, PT-Data=AS2022.07 | 97.6 | |
| Audio-MAE#Param=86M, Pre-training Data=AS2025.06 | 96.9 | |
| Audio-MAE (local)Backbone=ViT-B, PT-Data=AS2022.07 | 96.9 | |
| SSAMBAModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 96.9 | |
| SSAMBAModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 96.4 | |
| HuBERTBackbone=Transformer, PT-Data=LS, Evaluation Protocol=Linear Evaluation2022.07 | 96.3 | |
| wav2vec 2.0Backbone=Transformer, PT-Data=LS, Evaluation Protocol=Linear Evaluation2022.07 | 96.2 | |
| SS-AST#Param=89M, Pre-training Data=AS+LS2025.06 | 96 | |
| SS-ASTBackbone=ViT-B, PT-Data=AS+LS2022.07 | 96 | |
| SSASTModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 96 | |
| MAE-AST#Param=86M, Pre-training Data=AS+LS2025.06 | 95.8 | |
| MAE-ASTBackbone=ViT-B, PT-Data=AS+LS2022.07 | 95.8 | |
| SSAMBAModel size=small, Pretrained=false, Head learning rate=larger2024.05 | 95.7 | |
| SSAMBAModel size=base, Pretrained=false, Head learning rate=normal2024.05 | 95.7 | |
| ASTBackbone=DeiT-B, PT-Data=IN2022.07 | 95.5 | |
| SSASTModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 95.4 | |
| SSASTModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 94.8 | |
| SSAMBAModel size=tiny, Pretrained=false, Head learning rate=larger2024.05 | 94.7 | |
| SSAMBAModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 94 |