Keyword Spotting on Speech Commands KS2 v2
98.9AccuracyASIT
Evaluation Results
| Method | Links | |
|---|---|---|
| ASIT#Param=86M, Pre-training Data=AS2025.06 | 98.9 | |
| A-JEPA#Param=86M, Pre-training Data=AS2025.06 | 98.5 | |
| Audio-MAE#Param=86M, Pre-training Data=AS2025.06 | 98.3 | |
| BEATSiter3#Param=90M, Pre-training Data=AS2025.06 | 98.3 | |
| EAT#Param=88M, Pre-training Data=AS2025.06 | 98.3 | |
| BEATSiter3+#Param=90M, Pre-training Data=AS, Supervised Fine-tuning=Included2025.06 | 98.1 | |
| SSLAM#Param=88M, Pre-training Data=AS2025.06 | 98.1 | |
| SS-AST#Param=89M, Pre-training Data=AS+LS2025.06 | 98 | |
| MAE-AST#Param=86M, Pre-training Data=AS+LS2025.06 | 97.9 | |
| SSASTModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 97.9 | |
| SSASTModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 97.8 | |
| MaskSpec#Param=86M, Pre-training Data=AS2025.06 | 97.7 | |
| Embedding + Head# Parameters, K=3852020.04 | 97.7 | |
| SSAMBAModel size=base, Pretrained=true, Head learning rate=normal2024.05 | 97.4 | |
| SSASTModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 97.1 | |
| Harmonic Tensor 2D-CNN2020.04 | 96.39 | |
| SSAMBAModel size=small, Pretrained=true, Head learning rate=larger2024.05 | 96.3 | |
| SSAMBAModel size=base, Pretrained=false, Head learning rate=normal2024.05 | 96.1 | |
| SSAMBAModel size=small, Pretrained=false, Head learning rate=larger2024.05 | 95.7 | |
| Attention RNN# Parameters, K=2022020.04 | 94.3 | |
| SSAMBAModel size=tiny, Pretrained=false, Head learning rate=larger2024.05 | 94.2 | |
| SSAMBAModel size=tiny, Pretrained=true, Head learning rate=larger2024.05 | 94 | |
| MSM-MAE#Param=86M, Pre-training Data=AS2025.06 | 87.3 |