Image Classification on ImageNet-1k (Custom Metrics)
88.5IN-1k AccSWAG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SWAGArchitecture=ViT-H/14, (Pre)training data=IG-3.6B, Evaluation protocol=Fine-tuning2022.12 | 88.5 | 9 | |
| SWAGBackbone=ViT-H/14, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | 88.5 | — | |
| SWAGBackbone=ViT-L/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | 88 | — | |
| MAEArchitecture=ViT-H/14, (Pre)training data=IN-1k, Evaluation protocol=Fine-tuning2022.12 | 86.9 | 8 | |
| MAEBackbone=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | 86.9 | — | |
| SWAGBackbone=RG-32gf, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | 86.8 | — | |
| MAEBackbone=ViT-L/16, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | 85.9 | — | |
| SWAGArchitecture=ViT-H/14, (Pre)training data=IG-3.6B, Evaluation protocol=Linear Probing2022.12 | 85.7 | 9 | |
| SWAGBackbone=ViT-H/14, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | 85.7 | — | |
| SWAGBackbone=ViT-B/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Fine-tuning2022.12 | 85.2 | — | |
| SWAGBackbone=ViT-L/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | 85.1 | — | |
| SWAGBackbone=RG-32gf, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | 84.6 | — | |
| MAEBackbone=ViT-B/16, Pre-training Data=IN-1k, Evaluation Protocol=Fine-tuning2022.12 | 83.7 | — | |
| SEERArchitecture=RG-32gf, (Pre)training data=IG-1B, Evaluation protocol=Fine-tuning2022.12 | 83.3 | 9 | |
| SEERBackbone=RG-32gf, Pre-training Data=IG-1B, Evaluation Protocol=Fine-tuning2022.12 | 83.3 | — | |
| BiT-MBackbone=ResNet-50v2, Pre-training Data=IN-21k2022.12 | 82.3 | — | |
| SWAGBackbone=ViT-B/16, Pre-training Data=IG-3.6B, Evaluation Protocol=Linear Probing2022.12 | 81.8 | — | |
| Greedy SoupArchitecture=ViT-B/32, (Pre)training data=WIT, Evaluation protocol=Fine-tuning2022.12 | 81 | 9 | |
| Greedy SoupBackbone=ViT-B/32, Pre-training Data=WIT, Evaluation Protocol=Fine-tuning2022.12 | 81 | — | |
| SupervisedBackbone=ViT-B/16, Pre-training Data=IN-1k2022.12 | 81 | — | |
| SupervisedArchitecture=RG-32gf, (Pre)training data=IN-1k2022.12 | 80.8 | 9 | |
| SupervisedBackbone=RG-32gf, Pre-training Data=IN-1k2022.12 | 80.8 | — | |
| RobustViTBackbone=ViT-B/16, Pre-training Data=IN-1k2022.12 | 80.3 | — | |
| Uniform SoupArchitecture=ViT-B/32, (Pre)training data=WIT, Evaluation protocol=Fine-tuning2022.12 | 79.9 | 9 | |
| Uniform SoupBackbone=ViT-B/32, Pre-training Data=WIT, Evaluation Protocol=Fine-tuning2022.12 | 79.9 | — | |
| SupervisedArchitecture=ViT-L/16, (Pre)training data=IN-1k2022.12 | 79.6 | 8 | |
| SupervisedBackbone=ViT-L/16, Pre-training Data=IN-1k2022.12 | 79.6 | — | |
| CutMixArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | 78.5 | 9 | |
| CutMixBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | 78.5 | — | |
| CLIPArchitecture=ViT-H/14, (Pre)training data=LAION-2B, Evaluation protocol=zero-shot2022.12 | 77.9 | 6 | |
| CLIPBackbone=ViT-H/14, Pre-training Data=LAION-2B, Evaluation Protocol=Zero-shot2022.12 | 77.9 | — | |
| AugMixArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | 77.5 | 9 | |
| AugMixBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | 77.5 | — | |
| CutoutArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | 77 | 8 | |
| CutoutBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | 77 | — | |
| MoCov3Backbone=ViT-B/16, Pre-training Data=IN-1k, Evaluation Protocol=Linear Probing2022.12 | 76.6 | — | |
| CLIPBackbone=ViT-G/14, Pre-training Data=LAION-2B, Evaluation Protocol=Zero-shot2022.12 | 76.6 | — | |
| CLIPArchitecture=ViT-L/14, (Pre)training data=WIT, Evaluation protocol=zero-shot2022.12 | 76.5 | 6 | |
| CLIPBackbone=ViT-L/14, Pre-training Data=WIT, Evaluation Protocol=Zero-shot2022.12 | 76.5 | — | |
| SupervisedArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | 76.1 | 7 | |
| MixupArchitecture=ResNet-50, (Pre)training data=IN-1k2022.12 | 76.1 | 7 | |
| SupervisedBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | 76.1 | — | |
| MixupBackbone=ResNet-50, Pre-training Data=IN-1k2022.12 | 76.1 | — | |
| SupervisedArchitecture=ViT-B/32, (Pre)training data=IN-1k2022.12 | 75.9 | 9 | |
| SupervisedBackbone=ViT-B/32, Pre-training Data=IN-1k2022.12 | 75.9 | — | |
| MoCov3Architecture=ResNet-50, (Pre)training data=IN-1k, Evaluation protocol=Linear Probing2022.12 | 74.6 | 8 | |
| MoCov3Backbone=ResNet-50, Pre-training Data=IN-1k, Evaluation Protocol=Linear Probing2022.12 | 74.6 | — | |
| CLIPArchitecture=ViT-L/14, (Pre)training data=LAION-400M, Evaluation protocol=zero-shot2022.12 | 72.7 | 5 | |
| CLIPBackbone=ViT-L/14, Pre-training Data=LAION-400M, Evaluation Protocol=Zero-shot2022.12 | 72.7 | — | |
| Style TransferArchitecture=ResNet-50, (Pre)training data=SIN2022.12 | 60.1 | 10 | |
| Style TransferBackbone=ResNet-50, Pre-training Data=SIN2022.12 | 60.1 | — |