Scene Classification on Places-205 (val)
56.7Top-1 AccSwAV
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SwAVEvaluation protocol=linear classifier on fixed features, multi-crop=true2021.03 | 56.7 | — | — | — | — | |
| BARLOW TWINSEvaluation protocol=linear classifier on fixed features2021.03 | 54.1 | — | — | — | — | |
| BYOLEvaluation protocol=linear classifier on fixed features2021.03 | 54 | — | — | — | — | |
| SupervisedEvaluation protocol=linear classifier on fixed features2021.03 | 53.2 | — | — | — | — | |
| SwAVEvaluation protocol=linear classifier on fixed features, multi-crop=false2021.03 | 52.8 | — | — | — | — | |
| SimCLREvaluation protocol=linear classifier on fixed features2021.03 | 52.5 | — | — | — | — | |
| MoCo-v2Evaluation protocol=linear classifier on fixed features2021.03 | 51.8 | — | — | — | — | |
| SwAV*#ImageNet labels=0%, #Pre-train epochs=800, k=256, Multi-crop augmentation=true, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 51 | — | — | — | — | |
| SwAV#ImageNet labels=0%, #Pre-train epochs=400, k=256, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 47.51 | — | — | — | — | |
| CoMatch#ImageNet labels=1%, #Pre-train epochs=400, k=256, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 47.32 | — | — | — | — | |
| CoMatch#ImageNet labels=10%, #Pre-train epochs=400, k=256, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 47.1 | — | — | — | — | |
| MoCov2#ImageNet labels=0%, #Pre-train epochs=800, k=256, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 46.96 | — | — | — | — | |
| SwAV*#ImageNet labels=0%, #Pre-train epochs=800, k=64, Multi-crop augmentation=true, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 46.01 | — | — | — | — | |
| Supervised#ImageNet labels=100%, #Pre-train epochs=90, k=256, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 45.74 | — | — | — | — | |
| Places labelsFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=Places (Supervised)2018.03 | 44.6 | — | — | — | — | |
| Places labelsFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=Places (Supervised)2018.03 | 43.3 | — | — | — | — | |
| CoMatch#ImageNet labels=10%, #Pre-train epochs=400, k=64, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 43.06 | — | — | — | — | |
| CoMatch#ImageNet labels=1%, #Pre-train epochs=400, k=64, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 42.97 | — | — | — | — | |
| SwAV#ImageNet labels=0%, #Pre-train epochs=400, k=64, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 42.6 | — | — | — | — | |
| MoCov2#ImageNet labels=0%, #Pre-train epochs=800, k=64, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 42.18 | — | — | — | — | |
| Supervised#ImageNet labels=100%, #Pre-train epochs=90, k=64, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 41.81 | — | — | — | — | |
| Places labelsFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=Places (Supervised)2018.03 | 40.2 | — | — | — | — | |
| ImageNet labelsFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Supervised)2018.03 | 39.4 | — | — | — | — | |
| ImageNet labelsFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Supervised)2018.03 | 38.7 | — | — | — | — | |
| ImageNet labelsFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Supervised)2018.03 | 38.4 | — | — | — | — | |
| SwAV*#ImageNet labels=0%, #Pre-train epochs=800, k=16, Multi-crop augmentation=true, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 38.38 | — | — | — | — | |
| CoMatch#ImageNet labels=10%, #Pre-train epochs=400, k=16, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 36.98 | — | — | — | — | |
| CoMatch#ImageNet labels=1%, #Pre-train epochs=400, k=16, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 36.56 | — | — | — | — | |
| CountingFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 36.3 | — | — | — | — | |
| Supervised#ImageNet labels=100%, #Pre-train epochs=90, k=16, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 35.95 | — | — | — | — | |
| SwAV#ImageNet labels=0%, #Pre-train epochs=400, k=16, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 35.65 | — | — | — | — | |
| Places labelsFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=Places (Supervised)2018.03 | 35.1 | — | — | — | — | |
| RotNetFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 35.1 | — | — | — | — | |
| MoCov2#ImageNet labels=0%, #Pre-train epochs=800, k=16, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 35.08 | — | — | — | — | |
| Jigsaw PuzzlesFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 35 | — | — | — | — | |
| ImageNet labelsFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Supervised)2018.03 | 34.8 | — | — | — | — | |
| CountingFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 34.7 | — | — | — | — | |
| RotNetFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 34.6 | — | — | — | — | |
| Jigsaw PuzzlesFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 34.2 | — | — | — | — | |
| Split-BrainFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 34.1 | — | — | — | — | |
| Split-BrainFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 34 | — | — | — | — | |
| CountingFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 33.9 | — | — | — | — | |
| RotNetFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 33.7 | — | — | — | — | |
| SwAV*#ImageNet labels=0%, #Pre-train epochs=800, k=8, Multi-crop augmentation=true, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 33.26 | — | — | — | — | |
| CoMatch#ImageNet labels=10%, #Pre-train epochs=400, k=8, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 33.05 | — | — | — | — | |
| ContextFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 32.7 | — | — | — | — | |
| Split-BrainFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 32.5 | — | — | — | — | |
| CoMatch#ImageNet labels=1%, #Pre-train epochs=400, k=8, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 32.36 | — | — | — | — | |
| Supervised#ImageNet labels=100%, #Pre-train epochs=90, k=8, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 32.08 | — | — | — | — | |
| ContextFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 31.9 | — | — | — | — | |
| Jigsaw PuzzlesFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 31.9 | — | — | — | — | |
| BIGANFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 31.8 | — | — | — | — | |
| BIGANFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 31.3 | — | — | — | — | |
| RotNetFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 31 | — | — | — | — | |
| SwAV#ImageNet labels=0%, #Pre-train epochs=400, k=8, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 31 | — | — | — | — | |
| ContextFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 30.9 | — | — | — | — | |
| Split-BrainFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 30.7 | — | — | — | — | |
| MoCov2#ImageNet labels=0%, #Pre-train epochs=800, k=8, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 30.64 | — | — | — | — | |
| ColorizationFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 30.3 | — | — | — | — | |
| ColorizationFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 29.7 | — | — | — | — | |
| BIGANFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 29.7 | — | — | — | — | |
| ColorizationFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 29.6 | — | — | — | — | |
| CountingFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 29.6 | — | — | — | — | |
| Jigsaw PuzzlesFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 29.3 | — | — | — | — | |
| BIGANFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 28.7 | — | — | — | — | |
| CoMatch#ImageNet labels=10%, #Pre-train epochs=400, k=1, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 28.11 | — | — | — | — | |
| Supervised#ImageNet labels=100%, #Pre-train epochs=90, k=1, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 27.2 | — | — | — | — | |
| CoMatch#ImageNet labels=1%, #Pre-train epochs=400, k=1, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 27.15 | — | — | — | — | |
| Random rescaledFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 27.1 | — | — | — | — | |
| SwAV*#ImageNet labels=0%, #Pre-train epochs=800, k=1, Multi-crop augmentation=true, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 27.07 | — | — | — | — | |
| ContextFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 26.7 | — | — | — | — | |
| Random rescaledFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 26.2 | — | — | — | — | |
| Random rescaledFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 26.1 | — | — | — | — | |
| ColorizationFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 25.7 | — | — | — | — | |
| MoCov2#ImageNet labels=0%, #Pre-train epochs=800, k=1, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 25.34 | — | — | — | — | |
| SwAV#ImageNet labels=0%, #Pre-train epochs=400, k=1, Backbone=ResNet-50, Evaluation Protocol=Linear SVM2020.11 | 25.32 | — | — | — | — | |
| Random rescaledFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 24 | — | — | — | — | |
| Context EncodersFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 23.4 | — | — | — | — | |
| CountingFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 23.3 | — | — | — | — | |
| Context EncodersFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 23.2 | — | — | — | — | |
| Jigsaw PuzzlesFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 23 | — | — | — | — | |
| ImageNet labelsFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Supervised)2018.03 | 22.7 | — | — | — | — | |
| Places labelsFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=Places (Supervised)2018.03 | 22.1 | — | — | — | — | |
| BIGANFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 22 | — | — | — | — | |
| Context EncodersFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 21.9 | — | — | — | — | |
| RotNetFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 21.5 | — | — | — | — | |
| Random rescaledFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 21.4 | — | — | — | — | |
| Split-BrainFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 21.3 | — | — | — | — | |
| RandomFeature Layer=Conv2, Architecture=AlexNet, Pre-training Dataset=None (Random weights)2018.03 | 20.3 | — | — | — | — | |
| RandomFeature Layer=Conv3, Architecture=AlexNet, Pre-training Dataset=None (Random weights)2018.03 | 19.8 | — | — | — | — | |
| ContextFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 19.7 | — | — | — | — | |
| RandomFeature Layer=Conv4, Architecture=AlexNet, Pre-training Dataset=None (Random weights)2018.03 | 19.1 | — | — | — | — | |
| Context EncodersFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 18.4 | — | — | — | — | |
| Context EncodersFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 18.2 | — | — | — | — | |
| RandomFeature Layer=Conv5, Architecture=AlexNet, Pre-training Dataset=None (Random weights)2018.03 | 17.5 | — | — | — | — | |
| ColorizationFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=ImageNet (Unsupervised)2018.03 | 16 | — | — | — | — | |
| RandomFeature Layer=Conv1, Architecture=AlexNet, Pre-training Dataset=None (Random weights)2018.03 | 15.7 | — | — | — | — |