Image Classification on Places
48.6Top-1 AccuracyMoCo + CC + A+ + kNN
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| MoCo + CC + A+ + kNNPre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true, Stronger augmentations=true, kNN nearest neighbors=true2021.06 | 48.6 | — | — | — | — | — | — | |
| MoCo + CC + A+Pre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true, Stronger augmentations=true2021.06 | 47 | — | — | — | — | — | — | |
| MoCo + CCPre-training Dataset=COCO, Pre-training Epochs=800, Constrained multi-crop=true2021.06 | 46.1 | — | — | — | — | — | — | |
| DenseCLPre-training Dataset=COCO, Pre-training Epochs=8002021.06 | 45.8 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=128, Fine-tuning=False2018.05 | 45.5 | — | — | — | — | — | — | |
| MoCoPre-training Dataset=COCO, Pre-training Epochs=8002021.06 | 44.7 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=128, Fine-tuning=False2018.05 | 42.1 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=kNN, Feature Dimension=128, Fine-tuning=False2018.05 | 41.6 | — | — | — | — | — | — | |
| VirTexPre-training Dataset=COCO captions2021.06 | 40.8 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=kNN, Feature Dimension=128, Fine-tuning=False2018.05 | 38.6 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=128, Fine-tuning=False2018.05 | 38.1 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=128, Fine-tuning=False2018.05 | 37 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=128, Fine-tuning=False2018.05 | 36.3 | — | — | — | — | — | — | |
| JigsawEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 35.5 | — | — | — | — | — | — | |
| JigsawEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 34.8 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=128, Fine-tuning=False2018.05 | 34.5 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 34.1 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 34 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=128, Fine-tuning=False2018.05 | 33.8 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=128, Fine-tuning=False2018.05 | 33.6 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=kNN, Feature Dimension=128, Fine-tuning=False2018.05 | 32.8 | — | — | — | — | — | — | |
| ContextEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 32.7 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 32.5 | — | — | — | — | — | — | |
| JigsawEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 32.1 | — | — | — | — | — | — | |
| ContextEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 31.9 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=128, Fine-tuning=False2018.05 | 31.9 | — | — | — | — | — | — | |
| ColorEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 31.8 | — | — | — | — | — | — | |
| ColorEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 31.3 | — | — | — | — | — | — | |
| JigsawEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 31.3 | — | — | — | — | — | — | |
| AdversarialEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 31 | — | — | — | — | — | — | |
| ContextEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 30.9 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 30.7 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=kNN, Feature Dimension=128, Fine-tuning=False2018.05 | 30.1 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=128, Fine-tuning=False2018.05 | 30.1 | — | — | — | — | — | — | |
| AdversarialEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 29.9 | — | — | — | — | — | — | |
| VideoEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 29.9 | — | — | — | — | — | — | |
| VideoEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 29.7 | — | — | — | — | — | — | |
| ColorEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 29.7 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=128, Fine-tuning=False2018.05 | 29.7 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=128, Fine-tuning=False2018.05 | 29.5 | — | — | — | — | — | — | |
| ColorEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 28.7 | — | — | — | — | — | — | |
| VideoEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 28.5 | — | — | — | — | — | — | |
| AdversarialEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 28 | — | — | — | — | — | — | |
| VideoEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 27.9 | — | — | — | — | — | — | |
| Data-InitEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 27.1 | — | — | — | — | — | — | |
| ContextEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 26.7 | — | — | — | — | — | — | |
| Data-InitEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 26.2 | — | — | — | — | — | — | |
| Data-InitEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 26.1 | — | — | — | — | — | — | |
| AdversarialEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 24.5 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=128, Fine-tuning=False2018.05 | 24.3 | — | — | — | — | — | — | |
| Data-InitEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 24 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=128, Fine-tuning=False2018.05 | 23.1 | — | — | — | — | — | — | |
| JigsawEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 23 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=128, Fine-tuning=False2018.05 | 23 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=128, Fine-tuning=False2018.05 | 22.3 | — | — | — | — | — | — | |
| ColorEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 22 | — | — | — | — | — | — | |
| Data-InitEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 21.4 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 21.3 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=Linear Classifier, Evaluation Layer=conv2, Feature Dimension=10K, Fine-tuning=False2018.05 | 20.3 | — | — | — | — | — | — | |
| VideoEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 20.1 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=Linear Classifier, Evaluation Layer=conv3, Feature Dimension=10K, Fine-tuning=False2018.05 | 19.8 | — | — | — | — | — | — | |
| ContextEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 19.7 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=Linear Classifier, Evaluation Layer=conv4, Feature Dimension=10K, Fine-tuning=False2018.05 | 19.1 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (AlexNet)Backbone=AlexNet, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=128, Fine-tuning=False2018.05 | 18.8 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-50)Backbone=ResNet-50, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=128, Fine-tuning=False2018.05 | 18.1 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (ResNet-18)Backbone=ResNet-18, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=128, Fine-tuning=False2018.05 | 17.8 | — | — | — | — | — | — | |
| AdversarialEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 17.7 | — | — | — | — | — | — | |
| Non-Parametric Instance Discrimination (VGG16)Backbone=VGG16, Evaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=128, Fine-tuning=False2018.05 | 17.6 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=Linear Classifier, Evaluation Layer=conv5, Feature Dimension=10K, Fine-tuning=False2018.05 | 17.5 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=Linear Classifier, Evaluation Layer=conv1, Feature Dimension=10K, Fine-tuning=False2018.05 | 15.7 | — | — | — | — | — | — | |
| SplitBrainEvaluation Protocol=kNN, Feature Dimension=10K, Fine-tuning=False2018.05 | 10.8 | — | — | — | — | — | — | |
| RandomEvaluation Protocol=kNN, Feature Dimension=10K, Fine-tuning=False2018.05 | 3.9 | — | — | — | — | — | — | |
| AETevaluation_protocol=1-crop, backbone=Larger AlexNet variant2019.11 | — | 22.1 | 32.9 | 37.1 | 36.2 | 34.7 | — | |
| Artifactsevaluation_protocol=1-crop, backbone=AlexNet2019.11 | — | 23.3 | 34.3 | 36.9 | 37.3 | 34.4 | — | |
| BEiT-B/16 + CLIPImg. encoder=BEiT-B/16, Txt. encoder=CLIP2026.05 | — | — | — | — | — | — | 34.34 | |
| BEiT-B/16 + MiniLMImg. encoder=BEiT-B/16, Txt. encoder=MiniLM2026.05 | — | — | — | — | — | — | 20.61 | |
| BEiT-B/16 + MPNetImg. encoder=BEiT-B/16, Txt. encoder=MPNet2026.05 | — | — | — | — | — | — | 26.29 | |
| BEiT-B/16 + RoBERTaImg. encoder=BEiT-B/16, Txt. encoder=RoBERTa2026.05 | — | — | — | — | — | — | 25.86 | |
| BiGANevaluation_protocol=1-crop, backbone=AlexNet2019.11 | — | 22 | 28.7 | 31.8 | 31.3 | 29.7 | — | |
| BYOLBackbone=ResNet-50, Pre-trained=ImageNet, Shot=5-shot, Way=5-way, Number of tasks=6002023.03 | — | — | — | — | — | — | 75.43 | |
| BYOL + PsCoBackbone=ResNet-50, Pre-trained=ImageNet, Shot=5-shot, Way=5-way, Number of tasks=6002023.03 | — | — | — | — | — | — | 83.8 | |
| CAFormer-S18 + CLIPImg. encoder=CAFormer-S18, Txt. encoder=CLIP2026.05 | — | — | — | — | — | — | 32.85 | |
| CAFormer-S18 + MiniLMImg. encoder=CAFormer-S18, Txt. encoder=MiniLM2026.05 | — | — | — | — | — | — | 20.27 | |
| CAFormer-S18 + MPNetImg. encoder=CAFormer-S18, Txt. encoder=MPNet2026.05 | — | — | — | — | — | — | 25.28 | |
| CAFormer-S18 + RoBERTaImg. encoder=CAFormer-S18, Txt. encoder=RoBERTa2026.05 | — | — | — | — | — | — | 27.33 | |
| CC+VGGevaluation_protocol=1-crop, backbone=AlexNet, training=self-label transfer from ResNet-502019.11 | — | 22.9 | 34.2 | 37.5 | 37.1 | 34.4 | — | |
| CDMBackbone=CLIP ViT-B/162025.10 | — | — | — | — | — | — | 52.6 | |
| CLIP RN-101Img. encoder=CLIP RN-1012026.05 | — | — | — | — | — | — | 36 | |
| CLIP RN-50Img. encoder=CLIP RN-502026.05 | — | — | — | — | — | — | 36.96 | |
| CLIP ViT-B/16Img. encoder=CLIP ViT-B/162026.05 | — | — | — | — | — | — | 38.96 | |
| CLIP ViT-B/32Img. encoder=CLIP ViT-B/322026.05 | — | — | — | — | — | — | 38.71 | |
| Colorizationevaluation_protocol=1-crop, backbone=AlexNet2019.11 | — | 16 | 25.7 | 29.6 | 30.3 | 29.7 | — | |
| Contextevaluation_protocol=1-crop, backbone=Larger AlexNet variant2019.11 | — | 19.7 | 26.7 | 31.9 | 32.7 | 30.9 | — | |
| Context 2evaluation_protocol=1-crop, backbone=AlexNet2019.11 | — | 23.7 | 34.2 | 37.2 | 37.2 | 34.9 | — | |
| ConvFormer-S18 + CLIPImg. encoder=ConvFormer-S18, Txt. encoder=CLIP2026.05 | — | — | — | — | — | — | 32.67 | |
| ConvFormer-S18 + MiniLMImg. encoder=ConvFormer-S18, Txt. encoder=MiniLM2026.05 | — | — | — | — | — | — | 19.29 | |
| ConvFormer-S18 + MPNetImg. encoder=ConvFormer-S18, Txt. encoder=MPNet2026.05 | — | — | — | — | — | — | 24.63 | |
| ConvFormer-S18 + RoBERTaImg. encoder=ConvFormer-S18, Txt. encoder=RoBERTa2026.05 | — | — | — | — | — | — | 26.57 | |
| ConvNext-B + CLIPImg. encoder=ConvNext-B, Txt. encoder=CLIP2026.05 | — | — | — | — | — | — | 35.09 | |
| ConvNext-B + MiniLMImg. encoder=ConvNext-B, Txt. encoder=MiniLM2026.05 | — | — | — | — | — | — | 22.61 |