Keyword Spotting on Google Speech Commands V2 (test)
98.7AccuracyBC-ResNet-8
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| BC-ResNet-8#Param=321k, #Mult=89.1M2021.06 | 98.7 | — | — | — | — | |
| BC-ResNet-6#Param=188k, #Mult=53.1M2021.06 | 98.6 | — | — | — | — | |
| BC-ResNet-3#Param=54.2k, #Mult=16.2M2021.06 | 98.2 | — | — | — | — | |
| AST-IM + KDPretraining=ImageNet + Knowledge Distillation2021.10 | 98.1 | — | — | — | — | |
| SSAST 250Masked Patches=250, Pretraining=Self-Supervised2021.10 | 98.1 | — | — | — | — | |
| MHAtt-RNNmodel size=743K2020.05 | 98 | 10 | — | — | — | |
| MHAtt-RNNimplementation=Optimized (SpecAugment + tuning)2020.05 | 98 | — | — | — | — | |
| SSAST 400Masked Patches=400, Pretraining=Self-Supervised2021.10 | 98 | — | — | — | — | |
| MHAtt-RNN#Param=743k, #Mult=22.7M2021.06 | 98 | — | — | — | — | |
| BC-ResNet-2#Param=27.3k, #Mult=8.5M2021.06 | 97.8 | — | — | — | — | |
| Embed+headimplementation=Baseline Reference2020.05 | 97.7 | — | — | — | — | |
| Embedding+head#Param=385k2021.06 | 97.7 | — | — | — | — | |
| BC-ResNet-1.5#Param=17.2k, #Mult=5.5M2021.06 | 97.6 | — | — | — | — | |
| LSTMimplementation=Optimized (SpecAugment + tuning)2020.05 | 97.5 | — | — | — | — | |
| CRNNimplementation=Optimized (SpecAugment + tuning)2020.05 | 97.5 | — | — | — | — | |
| TC-ResNetmodel size=365K2020.05 | 97.4 | 5 | — | — | — | |
| TC-ResNetimplementation=Optimized (SpecAugment + tuning)2020.05 | 97.4 | — | — | — | — | |
| MatchboxNet-6x2x64#Param=140k, #Mult=17.1M2021.06 | 97.4 | — | — | — | — | |
| GRUimplementation=Optimized (SpecAugment + tuning)2020.05 | 97.2 | — | — | — | — | |
| MatchboxNet-3x2x64#Param=93k, #Mult=11.3M2021.06 | 97.2 | — | — | — | — | |
| DSCNN+strdimplementation=Optimized (SpecAugment + tuning)2020.05 | 97.1 | — | — | — | — | |
| DSCNN+strdmodel size=485K2020.05 | 97 | 9 | — | — | — | |
| RES-152022.02 | 97 | — | — | — | — | |
| SVDFmodel size=354K2020.05 | 96.9 | 5 | 0.6 | — | — | |
| DSCNNmodel size=490K2020.05 | 96.9 | 19 | 1.6 | — | — | |
| SVDFimplementation=Optimized (SpecAugment + tuning)2020.05 | 96.9 | — | — | — | — | |
| Att-RNNimplementation=Baseline Reference2020.05 | 96.9 | — | — | — | — | |
| Att-RNN#Param=202k, #Mult=22.3M2021.06 | 96.9 | — | — | — | — | |
| BC-ResNet-1#Param=9.2k, #Mult=3.1M2021.06 | 96.9 | — | — | — | — | |
| MatchboxNet-3x1x64#Param=77k, #Mult=9.3M2021.06 | 96.9 | — | — | — | — | |
| CRNN (S)model size=467K, stateful=true2020.05 | 96.5 | 9 | 0.5 | — | — | |
| GRU (S)model size=593K, stateful=true2020.05 | 96.3 | 11 | 0.5 | — | — | |
| AST-AudioSetPretraining=Supervised AudioSet2021.10 | 96.2 | — | — | — | — | |
| CNNmodel size=606K2020.05 | 96 | 15 | 1.5 | — | — | |
| CNN+strdmodel size=529K2020.05 | 95.6 | 6 | — | — | — | |
| CNN+strdimplementation=Optimized (SpecAugment + tuning)2020.05 | 95.6 | — | — | — | — | |
| DCLS-DelaysParams (K)=25002026.06 | 95.3 | — | — | — | — | |
| CNN (INT8)Precision=INT8, Number of Seeds=5, Backbone=three-block depthwise-separable CNN [26]2026.04 | 95.2 | — | — | — | — | |
| S2S (Large)Params (K)=18202026.06 | 94.97 | — | — | — | — | |
| SIDC-KWSParams (K)=4032026.06 | 94.7 | — | — | — | — | |
| EdgeSpikeNumber of Seeds=52026.04 | 94.1 | — | — | 1.1 | 0.004 | |
| ED-sKWSParams (K)=3072026.06 | 93.1 | — | — | — | — | |
| S2S (Small)Params (K)=6992026.06 | 92.64 | — | — | — | — | |
| AST-ScratchTraining=From scratch2021.10 | 92.6 | — | — | — | — | |
| SRNN+ALIFParams (K)=2222026.06 | 92.5 | — | — | — | — | |
| DNNmodel size=447K2020.05 | 90.6 | 4 | 0.6 | — | — | |
| DNNimplementation=Optimized (SpecAugment + tuning)2020.05 | 90.6 | — | — | — | — | |
| S2S (Tiny)Params (K)=352026.06 | 89.8 | — | — | — | — | |
| Speech2SpikesParams (K)=4102026.06 | 89.5 | — | — | — | — |