Digit Classification on MNIST (test)
0.21Error RateRegularization of neural networks
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Regularization of neural networksyear=20132014.12 | 0.21 | — | |
| Multi-column deep neural networksyear=20122014.12 | 0.23 | — | |
| Both losses (Transformation + Mutual-exclusivity)Number of labeled training samples=all, Backbone=Sparse Convolutional Network2016.06 | 0.27 | — | |
| Transformation/Stability lossNumber of labeled training samples=all, Backbone=Sparse Convolutional Network2016.06 | 0.29 | — | |
| Mutual-exclusivity lossNumber of labeled training samples=all, Backbone=Sparse Convolutional Network2016.06 | 0.3 | — | |
| Labeled data only (Supervised baseline)Number of labeled training samples=all, Backbone=Sparse Convolutional Network2016.06 | 0.32 | — | |
| MSRV+C-SVDDNetMulti-Scale Receptive Voting=true2014.12 | 0.35 | — | |
| MSRV+K-meansNetMulti-Scale Receptive Voting=true2014.12 | 0.36 | — | |
| Ladder Network BaselineNumber of labeled training samples=all2016.06 | 0.36 | — | |
| Deeply-Supervised Netsyear=20142014.12 | 0.39 | — | |
| C-SVDDNetnumber of features=4002014.12 | 0.43 | — | |
| Maxout Networksyear=20132014.12 | 0.45 | — | |
| K-meansNetnumber of features=4002014.12 | 0.45 | — | |
| Network in Networkyear=20132014.12 | 0.47 | — | |
| Network in Network2017.06 | 0.47 | — | |
| PointNet++2017.06 | 0.51 | — | |
| Both losses (Transformation + Mutual-exclusivity)Number of labeled training samples=100, Backbone=Sparse Convolutional Network2016.06 | 0.55 | — | |
| PCANetyear=20142014.12 | 0.62 | — | |
| HOPE-movMFK=12002015.02 | 0.64 | — | |
| HOPE-movMFK=16002015.02 | 0.67 | — | |
| HOPE-movMFK=8002015.02 | 0.71 | — | |
| PCA-movMFK=12002015.02 | 0.73 | — | |
| PCA-movMFK=16002015.02 | 0.74 | — | |
| PCA-movMFK=8002015.02 | 0.75 | — | |
| HOPE-movMFK=4002015.02 | 0.76 | — | |
| Transformation/Stability lossNumber of labeled training samples=100, Backbone=Sparse Convolutional Network2016.06 | 0.76 | — | |
| PointNet2017.06 | 0.78 | — | |
| LeNet52017.06 | 0.8 | — | |
| spkmeansK=16002015.02 | 0.81 | — | |
| movMFK=12002015.02 | 0.81 | — | |
| Convolutional Deep Belief Networksyear=20092014.12 | 0.82 | — | |
| movMFK=8002015.02 | 0.82 | — | |
| movMFK=16002015.02 | 0.84 | — | |
| spkmeansK=12002015.02 | 0.86 | — | |
| PCA-movMFK=4002015.02 | 0.87 | — | |
| movMFK=4002015.02 | 0.89 | — | |
| Ladder NetworkNumber of labeled training samples=1002016.06 | 0.89 | — | |
| spkmeansK=8002015.02 | 0.9 | — | |
| Deep Boltzmann Machinesyear=20092014.12 | 0.95 | — | |
| C-SVDDnumber of features=16002014.12 | 0.99 | — | |
| K-meansnumber of features=16002014.12 | 1.01 | — | |
| spkmeansK=4002015.02 | 1.09 | — | |
| kmeansK=16002015.02 | 1.13 | — | |
| kmeansK=12002015.02 | 1.16 | — | |
| PointNet (vanilla)2017.06 | 1.3 | — | |
| kmeansK=8002015.02 | 1.31 | — | |
| kmeansK=4002015.02 | 1.41 | — | |
| Multi-layer perceptron2017.06 | 1.6 | — | |
| M1+M2labeled samples (N)=30002014.06 | 2.18 | — | |
| M1+M2labeled samples (N)=10002014.06 | 2.4 | — | |
| MTClabeled samples (N)=30002014.06 | 2.57 | — | |
| M1+M2labeled samples (N)=6002014.06 | 2.59 | — | |
| CAElabeled samples (N)=30002014.06 | 3.22 | — | |
| M1+M2labeled samples (N)=1002014.06 | 3.33 | — | |
| SVMlabeled samples (N)=30002014.06 | 3.35 | — | |
| TSVMlabeled samples (N)=30002014.06 | 3.45 | — | |
| M1+TSVMlabeled samples (N)=30002014.06 | 3.49 | — | |
| M2labeled samples (N)=10002014.06 | 3.6 | — | |
| MTClabeled samples (N)=10002014.06 | 3.64 | — | |
| AtlasRBFlabeled samples (N)=10002014.06 | 3.68 | — | |
| M2labeled samples (N)=30002014.06 | 3.92 | — | |
| Mutual-exclusivity lossNumber of labeled training samples=100, Backbone=Sparse Convolutional Network2016.06 | 3.92 | — | |
| M1+TSVMlabeled samples (N)=10002014.06 | 4.24 | — | |
| CAElabeled samples (N)=10002014.06 | 4.77 | — | |
| M2labeled samples (N)=6002014.06 | 4.94 | — | |
| MTClabeled samples (N)=6002014.06 | 5.13 | — | |
| TSVMlabeled samples (N)=10002014.06 | 5.38 | — | |
| Labeled data only (Supervised baseline)Number of labeled training samples=100, Backbone=Sparse Convolutional Network2016.06 | 5.44 | — | |
| M1+TSVMlabeled samples (N)=6002014.06 | 5.72 | — | |
| NNlabeled samples (N)=30002014.06 | 6.04 | — | |
| TSVMlabeled samples (N)=6002014.06 | 6.16 | — | |
| CAElabeled samples (N)=6002014.06 | 6.3 | — | |
| Ladder Network BaselineNumber of labeled training samples=1002016.06 | 6.43 | — | |
| SVMlabeled samples (N)=10002014.06 | 6.45 | — | |
| SVMlabeled samples (N)=6002014.06 | 7.68 | — | |
| AtlasRBFlabeled samples (N)=1002014.06 | 8.1 | — | |
| NNlabeled samples (N)=10002014.06 | 10.7 | — | |
| NNlabeled samples (N)=6002014.06 | 11.44 | — | |
| M1+TSVMlabeled samples (N)=1002014.06 | 11.82 | — | |
| M2labeled samples (N)=1002014.06 | 11.97 | — | |
| MTClabeled samples (N)=1002014.06 | 12.03 | — | |
| CAElabeled samples (N)=1002014.06 | 13.47 | — | |
| TSVMlabeled samples (N)=1002014.06 | 16.81 | — | |
| SVMlabeled samples (N)=1002014.06 | 22.98 | — | |
| Batch-normalized Max-out NINData Augmentation=None2018.02 | 24 | — | |
| SimpNetData Augmentation=None, Fine-tuning=No2018.02 | 25 | — | |
| NNlabeled samples (N)=1002014.06 | 25.81 | — | |
| RCNN-96Data Augmentation=None2018.02 | 31 | — | |
| NHLmode=test-time adaptation2023.03 | 31.2 | — | |
| Deeply Supervised NetworkData Augmentation=None2018.02 | 39 | — | |
| NORMmode=test-time adaptation, pre-trained source model=pytorch-playground [6]2023.03 | 39.6 | — | |
| Max-out network (k=2)Data Augmentation=None2018.02 | 45 | — | |
| Network In NetworkData Augmentation=None2018.02 | 45 | — | |
| TENTmode=test-time adaptation, pre-trained source model=pytorch-playground [6]2023.03 | 45.8 | — | |
| BPArchitecture=FF (2x256 neurons)2022.07 | — | 98.29 | |
| LCP - DIArchitecture=FF (2x256 neurons)2022.07 | — | 98.11 | |
| LCP - DIArchitecture=RNN (256 neurons)2022.07 | — | 97.58 | |
| LCP - DI (KP)Architecture=FF (2x256 neurons)2022.07 | — | 98.14 | |
| LCP - DI (KP)Architecture=RNN (256 neurons)2022.07 | — | 97.75 | |
| LCP - EBDArchitecture=FF (2x256 neurons)2022.07 | — | 98 |