Image Classification on Flowers
99.75AccuracyViT-22B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ViT-22BEvaluation Protocol=Linear, Resolution=224, Seeds=32023.02 | 99.75 | — | |
| ViT-22BEvaluation Protocol=H2T (Head2Toe), Resolution=224, Seeds=32023.02 | 99.69 | — | |
| DeCLIPTask=Linear Probe, Pretrain Dataset=88M, Image Encoder=ResNet502022.04 | 99.2 | — | |
| Grafit RegNetY-8GF#Param=39M, FLOPs=23.4G, Model Type=CNN, Design Type=Manual2021.07 | 99 | — | |
| EfficientNet-B7Number of Parameters=64M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 98.8 | — | |
| AutoFormer-S#Param=23M, FLOPs=16.5G, Model Type=Trans, Design Type=Auto, Resolution=384x3842021.07 | 98.8 | — | |
| ISyNet-N32021.09 | 98.72 | — | |
| ISyNet-N22021.09 | 98.59 | — | |
| Inception-v4Number of Parameters=41M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 98.5 | — | |
| EfficientNet-B5Number of Parameters=28M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 98.5 | — | |
| EfficientNet-B5#Param=30M, FLOPs=9.5G, Model Type=CNN, Design Type=Auto2021.07 | 98.5 | — | |
| DeiT-B#Param=86M, FLOPs=55.4G, Model Type=Trans, Design Type=Manual, Resolution=384x3842021.07 | 98.5 | — | |
| ResNet-50+2021.09 | 98.47 | — | |
| ISyNet-N1-S32021.09 | 98.36 | — | |
| ISyNet-N1-S22021.09 | 98.21 | — | |
| Grafit ResNet-50#Param=25M, FLOPs=12.1G, Model Type=CNN, Design Type=Manual2021.07 | 98.2 | — | |
| IndividualBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=12024.05 | 98.19 | — | |
| ISyNet-N12021.09 | 97.97 | — | |
| ISyNet-N1-S12021.09 | 97.95 | — | |
| DATDomain Adaptive Transfer Learning=true2019.05 | 97.7 | — | |
| EMR-MERGINGBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=302024.05 | 97.66 | — | |
| ResNet-34+2021.09 | 97.64 | — | |
| Supervised-INArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Fine-tuned2020.06 | 97.6 | — | |
| ViT-22BEvaluation Protocol=Finetuning, Resolution=224, Seeds=32023.02 | 97.59 | — | |
| ISyNet-N02021.09 | 97.55 | — | |
| bert2BERTTraining mode=Training from the Pretrained Model: M(12,384) → M(12,768), FLOPs (x 1e18)=4.6, Ratio (Saving)=64.4%2023.10 | 97.51 | — | |
| MangoTraining mode=Training from the Pretrained Model: M(12,384) → M(12,768), FLOPs (x 1e18)=3.0, Ratio (Saving)=76.4%2023.10 | 97.49 | — | |
| StackBERTTraining mode=Training from Scratch, FLOPs (x 1e18)=11.3, Ratio (Saving)=12.6%2023.10 | 97.44 | — | |
| ScratchTraining mode=Training from Scratch, FLOPs (x 1e18)=12.92023.10 | 97.27 | — | |
| ResNet-18+2021.09 | 97.19 | — | |
| LIGOTraining mode=Training from the Pretrained Model: M(12,384) → M(12,768), FLOPs (x 1e18)=5.7, Ratio (Saving)=55.7%2023.10 | 97.18 | — | |
| BYOLArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Fine-tuned2020.06 | 97 | — | |
| SimCLRArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Fine-tuned2020.06 | 97 | — | |
| TAPSBackbone=ResNet-50, Param Count=4.12x2022.03 | 96.68 | — | |
| SimCLR (repro)Architecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Fine-tuned2020.06 | 96.6 | — | |
| WTPBBackbone=ResNet-50, Param Count=6x (2.25x)2022.03 | 96.5 | — | |
| Spot-tuneBackbone=ResNet-50, Param Count=7x (7x)2022.03 | 96.34 | — | |
| BYOLArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Linear evaluation2020.06 | 96.1 | — | |
| CLIPTask=Linear Probe, Pretrain Dataset=400M, Image Encoder=ResNet502022.04 | 96.1 | — | |
| BA^2Backbone=ResNet-50, Param Count=3.8x (1.71x)2022.03 | 95.74 | — | |
| Fine-TuningBackbone=ResNet-50, Param Count=6x2022.03 | 95.73 | — | |
| AdaMergingBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=302024.05 | 95.69 | — | |
| RegMeanBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=302024.05 | 95.26 | — | |
| PiggybackBackbone=ResNet-50, Param Count=6x (2.25x)2022.03 | 94.76 | — | |
| Supervised-INArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Linear evaluation2020.06 | 94.7 | — | |
| CLIPTask=Linear Probe, Pretrain Dataset=143M, Image Encoder=ResNet502022.04 | 93.2 | — | |
| PacknetBackbone=ResNet-50, Param Count=(1.60x), Task Adding Order=Forward2022.03 | 93 | — | |
| PyramidCLIPTask=Linear Probe, Pretrain Dataset=143M, Image Encoder=ResNet502022.04 | 93 | — | |
| SimCLR (repro)Architecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Linear evaluation2020.06 | 92.6 | — | |
| Random initArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Fine-tuned2020.06 | 92 | — | |
| SimCLRArchitecture=ResNet-50, Pre-training Dataset=ImageNet, Evaluation Protocol=Linear evaluation2020.06 | 91.2 | — | |
| BASIC-LBackbone=BASIC-L2021.11 | 91.2 | — | |
| PacknetBackbone=ResNet-50, Param Count=(1.60x), Task Adding Order=Reverse2022.03 | 90.6 | — | |
| ViT-B/16#Param=86M, FLOPs=55.4G, Model Type=Trans, Design Type=Manual2021.07 | 89.5 | — | |
| Feature ExtractorBackbone=ResNet-50, Param Count=1x2022.03 | 89.14 | — | |
| SSPStudent Model=LCNet-35, Teacher Selection Metric=SSP2026.05 | 88.6 | — | |
| R12Student Model=LCNet-35, Teacher Selection Metric=R122026.05 | 88.6 | — | |
| GIF-SDBackbone=ResNet-50, Expansion Factor=20x2022.11 | 88.3 | — | |
| GIF-DALLEBackbone=ResNet-50, Expansion Factor=20x2022.11 | 88.2 | — | |
| X+OS_SimCoreCriterion=Stopping Criterion2023.03 | 87.04 | — | |
| BASIC-MBackbone=BASIC-M2021.11 | 86 | — | |
| GIF-MAEBackbone=ResNet-50, Expansion Factor=20x2022.11 | 84.4 | — | |
| DALL-E2Backbone=ResNet-50, Expansion Factor=20x2022.11 | 84.1 | — | |
| Task ArithmeticBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=302024.05 | 80.68 | — | |
| X2023.03 | 80.14 | — | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 79.4 | — | |
| SDBackbone=ResNet-50, Expansion Factor=20x2022.11 | 78.8 | — | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 78.7 | — | |
| CLIPBackbone=ViT-L/14-3362021.11 | 78.3 | — | |
| BYOL + OA-CropNetwork=ResNet-50, OA-Crop=GT2021.07 | 77.95 | — | |
| BYOL + OA-CropNetwork=ResNet-50, OA-Crop=ContraCAM2021.07 | 77.83 | — | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 77.7 | — | |
| TACStudent Model=LCNet-35, Teacher Selection Metric=TAC2026.05 | 77.6 | — | |
| MoCov2 + OA-CropNetwork=ResNet-50, OA-Crop=ContraCAM2021.07 | 77.33 | — | |
| BASIC-SBackbone=BASIC-S2021.11 | 76.8 | — | |
| MAEBackbone=ResNet-50, Expansion Factor=20x2022.11 | 76.3 | — | |
| MoCov2 + OA-CropNetwork=ResNet-50, OA-Crop=GT2021.07 | 75.09 | — | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 75 | — | |
| OriginalBackbone=ResNet-50, Expansion Factor=1x2022.11 | 74.1 | — | |
| BYOLAugSelf=true2021.11 | 74.07 | — | |
| BYOLNetwork=ResNet-50, OA-Crop=None2021.07 | 73.77 | — | |
| InMaP + ZLaPBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 73.4 | 2.6 | |
| BYOL + OA-CropNetwork=ResNet-18, OA-Crop=GT2021.07 | 73.25 | — | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 72.1 | — | |
| MoCov2Network=ResNet-50, OA-Crop=None2021.07 | 72.09 | — | |
| CoCoOpPrompts=tp+v, Backbone=ViT-16/B, Source Dataset=ImageNet, Shots=162023.03 | 71.88 | — | |
| InMaPBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 70.8 | — | |
| CEStudent Model=LCNet-35, Teacher Selection Metric=None (Cross-Entropy)2026.05 | 70.8 | — | |
| BYOL + OA-CropNetwork=ResNet-18, OA-Crop=ContraCAM2021.07 | 70.56 | — | |
| CLIPBackbone=ViT-B/162021.11 | 70.4 | — | |
| KgCoOpPrompts=tp, Backbone=ViT-16/B, Source Dataset=ImageNet, Shots=162023.03 | 70.01 | — | |
| TPTBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 69 | — | |
| Weight AveragingBackbone=ViT-B/16, Pre-trained=ImageNet-21k, Number of Merged Models=302024.05 | 68.97 | — | |
| CoOpPrompts=tp, Backbone=ViT-16/B, Source Dataset=ImageNet, Shots=162023.03 | 68.71 | — | |
| CLIP-DNBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 68 | — | |
| CLIP + ZLaPBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 67.9 | 0.9 | |
| ProGradPrompts=tp, Backbone=ViT-16/B, Source Dataset=ImageNet, Shots=162023.03 | 67.87 | — | |
| InMaP + ZLaPBackbone=ResNet-50, Evaluation Protocol=Transductive Zero-Shot2024.04 | 67.1 | 2.1 | |
| CLIPBackbone=ViT-B/16, Evaluation Protocol=Transductive Zero-Shot2024.04 | 67 | — | |
| BYOLAugSelf=false2021.11 | 66.89 | — |