Image Classification on ImageNet-W
-1.11IN-W GapMAE+LLE
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| MAE+LLEtrain data=IN-1k, evaluation protocol=Last Layer Ensemble, backbone=ViT-H2022.12 | -1.11 | — | — | — | — | — | — | |
| MAE+LLEBackbone=ViT-L/16, Evaluation Protocol=Fine-tuned2022.12 | -1.74 | — | — | — | — | — | — | |
| MAE+LLEBackbone=ViT-B/16, Evaluation Protocol=Fine-tuned2022.12 | -2.48 | — | — | — | — | — | — | |
| SWAGtrain data=IG-3.6B, evaluation protocol=fine-tuning, backbone=ViT-H2022.12 | -3.09 | — | — | — | — | — | — | |
| SWAGArchitecture=ViT-H/14, (Pre)training data=IG-3.6B, Evaluation protocol=Fine-tuning2022.12 | -3.1 | 0.35 | 18 | 20.25 | — | — | — | |
| SWAGBackbone=ViT-H/14, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | -3.1 | — | 18 | — | 9 | 0.35 | 20.25 | |
| SWAGBackbone=ViT-L/16, Evaluation Protocol=Fine-tuned, Pre-training Dataset=IG-3.6B2022.12 | -3.16 | — | — | — | — | — | — | |
| SWAGBackbone=ViT-L/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | -3.2 | — | 20 | — | 9 | 0.24 | 19.14 | |
| MAEtrain data=IN-1k, evaluation protocol=fine-tuning, backbone=ViT-H2022.12 | -3.48 | — | — | — | — | — | — | |
| MAEArchitecture=ViT-H/14, (Pre)training data=IN-1k, Evaluation protocol=Fine-tuning2022.12 | -3.5 | 0.43 | 30 | 29.59 | — | — | — | |
| MAEBackbone=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | -3.5 | — | 30 | — | 8 | 0.43 | 29.59 | |
| CLIPArchitecture=ViT-H/14, (Pre)training data=LAION-2B, Evaluation protocol=zero-shot2022.12 | -3.6 | 0.03 | 16 | 12.01 | — | — | — | |
| CLIPBackbone=ViT-H/14, Pre-training Data=LAION-2B, Evaluation Protocol=Zero-shot2022.12 | -3.6 | — | 16 | — | 6 | 0.03 | 12.01 | |
| CLIPtrain data=LAION-2B, evaluation protocol=zero-shot, backbone=ViT-H2022.12 | -3.61 | — | — | — | — | — | — | |
| CLIPBackbone=ViT-G/14, Pre-training Data=LAION-2B, Evaluation Protocol=Zero-shot2022.12 | -3.8 | — | 12 | — | 6 | 0.02 | 5.61 | |
| MAEBackbone=ViT-L/16, Evaluation Protocol=Fine-tuned2022.12 | -4.36 | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-L/14, (Pre)training data=WIT, Evaluation protocol=zero-shot2022.12 | -4.4 | 0.01 | 12 | 1.75 | — | — | — | |
| MAEBackbone=ViT-L/16, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | -4.4 | — | 22 | — | 9 | 0.5 | 22.7 | |
| CLIPBackbone=ViT-L/14, Pre-training Data=WIT, Evaluation Protocol=Zero-shot2022.12 | -4.4 | — | 12 | — | 6 | 0.01 | 1.75 | |
| CLIPBackbone=ViT-L/16, Evaluation Protocol=Zero-shot, Pre-training Dataset=WIT2022.12 | -4.47 | — | — | — | — | — | — | |
| SWAGBackbone=RG-32gf, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | -4.5 | — | 30 | — | 8 | 0.49 | 26.03 | |
| MAEBackbone=ViT-B/16, Evaluation Protocol=Fine-tuned2022.12 | -4.6 | — | — | — | — | — | — | |
| MAEBackbone=ViT-B/16, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | -4.6 | — | 24 | — | 9 | 0.67 | 22.46 | |
| SWAGtrain data=IG-3.6B, evaluation protocol=linear probing, backbone=ViT-H2022.12 | -4.89 | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-L/14, (Pre)training data=LAION-400M, Evaluation protocol=zero-shot2022.12 | -4.9 | 0.03 | 12 | 13.76 | — | — | — | |
| SWAGArchitecture=ViT-H/14, (Pre)training data=IG-3.6B, Evaluation protocol=Linear Probing2022.12 | -4.9 | 0.19 | 8 | 12.8 | — | — | — | |
| CLIPBackbone=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=Zero-shot2022.12 | -4.9 | — | 12 | — | 5 | 0.03 | 13.76 | |
| SWAGBackbone=ViT-H/14, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | -4.9 | — | 8 | — | 9 | 0.19 | 12.8 | |
| CLIPBackbone=ViT-L/16, Evaluation Protocol=Zero-shot, Pre-training Dataset=LAION2022.12 | -4.94 | — | — | — | — | — | — | |
| SWAGBackbone=ViT-B/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | -5.4 | — | 24 | — | 9 | 0.45 | 25.95 | |
| SWAGBackbone=ViT-B/16, Evaluation Protocol=Fine-tuned, Pre-training Dataset=IG-3.6B2022.12 | -5.43 | — | — | — | — | — | — | |
| SWAGBackbone=ViT-L/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | -5.7 | — | 6 | — | 8 | 0.23 | 9.72 | |
| SWAGBackbone=ViT-L/16, Evaluation Protocol=Linear Probing, Pre-training Dataset=IG-3.6B2022.12 | -5.73 | — | — | — | — | — | — | |
| ERMBackbone=ViT-L/162022.12 | -6.14 | — | — | — | — | — | — | |
| SupervisedArchitecture=ViT-L/16, (Pre)training data=IN-1k2022.12 | -6.2 | 0.82 | 34 | 32.57 | — | — | — | |
| SupervisedBackbone=ViT-L/16, Pre-training Data=IN-1k2022.12 | -6.2 | — | 34 | — | 8 | 0.82 | 32.57 | |
| Greedy SoupBackbone=ViT-B/32, Evaluation Protocol=Fine-tuned, Pre-training Dataset=WIT2022.12 | -6.47 | — | — | — | — | — | — | |
| SEERArchitecture=RG-32gf, (Pre)training data=IG-1B, Evaluation protocol=Fine-tuning2022.12 | -6.5 | 0.56 | 18 | 24.26 | — | — | — | |
| Greedy SoupArchitecture=ViT-B/32, (Pre)training data=WIT, Evaluation protocol=Fine-tuning2022.12 | -6.5 | 0.35 | 16 | 23.87 | — | — | — | |
| SEERBackbone=RG-32gf, Evaluation Protocol=Fine-tuned, Pre-training Dataset=IG-1B2022.12 | -6.5 | — | — | — | — | — | — | |
| SEERBackbone=RG-32gf, Pre-training Data=IG-1B, Evaluation Protocol=Fine-tuning2022.12 | -6.5 | — | 18 | — | 9 | 0.56 | 24.26 | |
| SWAGBackbone=RG-32gf, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | -6.5 | — | 22 | — | 8 | 0.36 | 20.56 | |
| Greedy SoupBackbone=ViT-B/32, Pre-training Data=WIT, Evaluation Protocol=Fine-tuning2022.12 | -6.5 | — | 16 | — | 9 | 0.35 | 23.87 | |
| ERMBackbone=ViT-B/162022.12 | -6.69 | — | — | — | — | — | — | |
| SupervisedBackbone=ViT-B/16, Pre-training Data=IN-1k2022.12 | -6.7 | — | 26 | — | 8 | 0.73 | 31.28 | |
| RobustViTBackbone=ViT-B/16, Pre-training Data=IN-1k2022.12 | -7.3 | — | 34 | — | 8 | 0.44 | 37.06 | |
| SWAGBackbone=ViT-B/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | -7.7 | — | 18 | — | 8 | 0.46 | 19.74 | |
| SWAGBackbone=ViT-B/16, Evaluation Protocol=Linear Probing, Pre-training Dataset=IG-3.6B2022.12 | -7.76 | — | — | — | — | — | — | |
| Uniform SoupArchitecture=ViT-B/32, (Pre)training data=WIT, Evaluation protocol=Fine-tuning2022.12 | -7.9 | 0.32 | 24 | 23.87 | — | — | — | |
| Uniform SoupBackbone=ViT-B/32, Evaluation Protocol=Fine-tuned, Pre-training Dataset=WIT2022.12 | -7.9 | — | — | — | — | — | — | |
| Uniform SoupBackbone=ViT-B/32, Pre-training Data=WIT, Evaluation Protocol=Fine-tuning2022.12 | -7.9 | — | 24 | — | 9 | 0.32 | 23.87 | |
| BiT-MBackbone=ResNet-50v2, Pre-training Data=IN-21k2022.12 | -8.6 | — | 28 | — | 9 | 0.6 | 29.73 | |
| SupervisedArchitecture=ViT-B/32, (Pre)training data=IN-1k2022.12 | -8.7 | 1.2 | 34 | 34.31 | — | — | — | |
| SupervisedBackbone=ViT-B/32, Pre-training Data=IN-1k2022.12 | -8.7 | — | 34 | — | 9 | 1.2 | 34.31 | |
| ERMBackbone=ViT-B/322022.12 | -8.71 | — | — | — | — | — | — | |
| SupervisedArchitecture=RG-32gf, (Pre)training data=IN-1k2022.12 | -14.1 | 3.74 | 32 | 33.43 | — | — | — | |
| SupervisedBackbone=RG-32gf, Pre-training Data=IN-1k2022.12 | -14.1 | — | 32 | — | 9 | 3.74 | 33.43 | |
| ERMBackbone=RG-32gf2022.12 | -14.15 | — | — | — | — | — | — | |
| CutMixArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | -14.8 | 1.92 | 22 | 29.61 | — | — | — | |
| CutMixBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | -14.8 | — | 22 | — | 9 | 1.92 | 29.61 | |
| MoCov3Backbone=ViT-B/16, Evaluation Protocol=Linear Probing2022.12 | -16 | — | — | — | — | — | — | |
| MoCov3Backbone=ViT-B/16, Pre-training Data=IN-1k, Evaluation Protocol=Linear Probing2022.12 | -16 | — | 22 | — | 9 | 1.97 | 38.34 | |
| AugMixArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | -16.8 | 2.61 | 36 | 34.44 | — | — | — | |
| AugMixBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | -16.8 | — | 36 | — | 9 | 2.61 | 34.44 | |
| Style TransferArchitecture=ResNet-50, (Pre)training data=SIN2022.12 | -17.3 | 4.91 | 52 | 50.06 | — | — | — | |
| Style TransferBackbone=ResNet-50, Pre-training Data=SIN2022.12 | -17.3 | — | 52 | — | 10 | 4.91 | 50.06 | |
| CutoutArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | -18 | 2.93 | 32 | 38.06 | — | — | — | |
| CutoutBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | -18 | — | 32 | — | 8 | 2.93 | 38.06 | |
| MixupArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | -18.6 | 3.43 | 38 | 39.78 | — | — | — | |
| MixupBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | -18.6 | — | 38 | — | 7 | 3.43 | 39.78 | |
| MoCov3Architecture=ResNet-50, (Pre)training data=IN-1k, Evaluation protocol=Linear Probing2022.12 | -20.7 | 2.94 | 44 | 44.37 | — | — | — | |
| MoCov3Backbone=ResNet-50, Pre-training Data=IN-1k, Evaluation Protocol=Linear Probing2022.12 | -20.7 | — | 44 | — | 8 | 2.94 | 44.37 | |
| SupervisedArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | -26.7 | 7.56 | 40 | 42.46 | — | — | — | |
| SupervisedBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | -26.7 | — | 40 | — | 7 | 7.56 | 42.46 |