Image Classification on ImageNet (Top-1 Accuracy)
94.43Top-1 AccuracyCoCoOp
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCoOpZSL setting=Inductive, Backbone=ViT-B/162024.03 | 94.43 | |
| CoOpZSL setting=Inductive, Backbone=ViT-B/162024.03 | 93.7 | |
| PromptKDZSL setting=Transductive, Backbone=ViT-B/162024.03 | 93.61 | |
| PromptSRCZSL setting=Inductive, Backbone=ViT-B/162024.03 | 93.6 | |
| MaPLeZSL setting=Inductive, Backbone=ViT-B/162024.03 | 93.53 | |
| M2-EncoderMode=Zero-shot, Parameters=10B2024.01 | 88.5 | |
| CoCaEvaluation Protocol=Zero-shot2022.05 | 86.3 | |
| CoCaZero-shot=true2022.09 | 86.3 | |
| CoCaMode=Zero-shot, Parameters=2.1B2024.01 | 86.3 | |
| BASICEvaluation Protocol=Zero-shot2022.05 | 85.7 | |
| BASIC-LBackbone=BASIC-L2021.11 | 85.7 | |
| BASICZero-shot=true2022.09 | 85.7 | |
| X-FM baseEval=FT, Multi-modal pre-training data size=1.3B2023.01 | 85.7 | |
| BASICMode=Zero-shot, Parameters=3B2024.01 | 85.7 | |
| BEiTv2Eval=FT2023.01 | 85.5 | |
| X-FM baseEval=FT, Multi-modal pre-training data size=4M2023.01 | 85.5 | |
| LiT ViT-eZero-shot=true2022.09 | 85.4 | |
| M2-EncoderMode=Zero-shot, Parameters=1B2024.01 | 85.4 | |
| OmniVLEval=FT, Multi-modal pre-training data size=14M2023.01 | 85.3 | |
| LiT ViT-gZero-shot=true2022.09 | 85.2 | |
| CoCa-LargeEvaluation Protocol=Zero-shot2022.05 | 84.8 | |
| CoCaMode=Zero-shot, Parameters=0.8B2024.01 | 84.8 | |
| LiTEvaluation Protocol=Zero-shot2022.05 | 84.5 | |
| OFAEval=FT, Multi-modal pre-training data size=21M2023.01 | 84.5 | |
| LiTMode=Zero-shot, Parameters=1B2024.01 | 84.5 | |
| SimVLMEval=FT, Multi-modal pre-training data size=1.8B2023.01 | 83.9 | |
| FlorenceEvaluation Protocol=Zero-shot2022.05 | 83.7 | |
| FlorenceMode=Zero-shot, Parameters=0.9B2024.01 | 83.7 | |
| CoCa-BaseEvaluation Protocol=Zero-shot2022.05 | 82.6 | |
| CoCaMode=Zero-shot, Parameters=0.4B2024.01 | 82.6 | |
| X2-VLMEval=FT, Multi-modal pre-training data size=1.3B2023.01 | 82.2 | |
| LeRaCModel=CvT-13, Training Regime=LeRaC (ours)2022.05 | 82.19 | |
| X-FM baseEval=LE, Multi-modal pre-training data size=1.3B2023.01 | 82 | |
| EVAMode=Zero-shot, Parameters=5.0B2024.01 | 82 | |
| Dr. ViTBackbone=ViT-B, Resolution=384x3842021.11 | 81.83 | |
| ViT-BBackbone=ViT-B, Resolution=384x3842021.11 | 81.63 | |
| Distill on real imagesTeacher Network=ResNet-101, Teacher Accuracy=77.37%, Student Network=DeiT-S, Dataset Partition=ImageNet2022.04 | 81.5 | |
| BASIC-MBackbone=BASIC-M2021.11 | 81.5 | |
| BASICMode=Zero-shot, Parameters=0.4B2024.01 | 81.5 | |
| conventionalModel=CvT-13, Training Regime=conventional2022.05 | 81.33 | |
| X-FM_baseLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 81.2 | |
| X-FM baseEval=LE, Multi-modal pre-training data size=4M2023.01 | 81.2 | |
| OmniVLEval=LE, Multi-modal pre-training data size=14M2023.01 | 81 | |
| X2-VLMEval=FT, Multi-modal pre-training data size=4M2023.01 | 80.8 | |
| X2-VLMEval=LE, Multi-modal pre-training data size=1.3B2023.01 | 80.6 | |
| CBSModel=CvT-13, Training Regime=CBS2022.05 | 80.42 | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 80.2 | |
| BEiTv2Eval=LE2023.01 | 80.1 | |
| OpenCLIPMode=Zero-shot, Parameters=2.5B2024.01 | 80 | |
| Train from scratchTeacher Network=ResNet-101, Teacher Accuracy=77.37%, Student Network=DeiT-S2022.04 | 79.8 | |
| 2SFS LoRABackbone=ViT-L/14, Shots (k=16)=16, Evaluation Protocol=all-to-all2025.03 | 79.7 | |
| Dr. ViTBackbone=ViT-B, Discrete Only=false2021.11 | 79.48 | |
| ViT-BBackbone=ViT-B2021.11 | 78.73 | |
| Dr. ViTBackbone=ViT-B, Discrete Only=true2021.11 | 78.67 | |
| OpenCLIPMode=Zero-shot, Parameters=1.3B2024.01 | 78.5 | |
| EVAMode=Zero-shot, Parameters=1.1B2024.01 | 78.5 | |
| M2-EncoderMode=Zero-shot, Parameters=0.4B2024.01 | 78.5 | |
| FILIPEvaluation Protocol=Zero-shot2022.05 | 78.3 | |
| FILIPMode=Zero-shot, Parameters=0.4B2024.01 | 78.3 | |
| CDARTS-bParams(M)=6.42020.06 | 78.2 | |
| DaVinciLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 77.7 | |
| Uni-PerEval=LE, Multi-modal pre-training data size=30M2023.01 | 77.7 | |
| FairNAS-AParams(M)=5.92020.06 | 77.5 | |
| CDARTS-aParams(M)=72020.06 | 77.4 | |
| Dr. ViTBackbone=ViT-S, Discrete Only=false2021.11 | 77.03 | |
| MixNet-MParams(M)=52020.06 | 77 | |
| MixPath-AParams(M)=52020.06 | 76.9 | |
| ResNet-50Backbone=ResNet-502021.11 | 76.61 | |
| ALIGNEvaluation Protocol=Zero-shot2022.05 | 76.4 | |
| ALIGNZero-shot=true2022.09 | 76.4 | |
| ALIGNMode=Zero-shot, Parameters=0.8B2024.01 | 76.4 | |
| CLIPEvaluation Protocol=Zero-shot2022.05 | 76.2 | |
| CLIPBackbone=ViT-L/14-3362021.11 | 76.2 | |
| CLIPZero-shot=true2022.09 | 76.2 | |
| CLIPMode=Zero-shot, Parameters=0.4B2024.01 | 76.2 | |
| OFAEval=LE, Multi-modal pre-training data size=21M2023.01 | 75.9 | |
| AdCoEpochs=800, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.7 | |
| ExactOBSModel=ResNet50, FLOP reduction target=2x2022.08 | 75.64 | |
| MnasNet-A2Params(M)=4.82020.06 | 75.6 | |
| NNCLREpochs=1000, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.6 | |
| AdaPruneModel=ResNet50, FLOP reduction target=2x2022.08 | 75.53 | |
| UniGrad (+ Cut-Mix)Epochs=800, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.5 | |
| FLAVALinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 75.5 | |
| X2-VLMEval=LE, Multi-modal pre-training data size=4M2023.01 | 75.5 | |
| L-OBSModel=ResNet50, FLOP reduction target=2x2022.08 | 75.48 | |
| SCEEpochs=200, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.4 | |
| SwaVEpochs=800, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.3 | |
| DINOEpochs=800, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 75.3 | |
| LlipData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 75.3 | |
| ViT-SBackbone=ViT-S2021.11 | 75.21 | |
| MobileNetV32020.06 | 75.2 | |
| Hybrid ViT-SBackbone=Hybrid ViT-S2021.11 | 75.1 | |
| ExactOBSModel=ResNet50, FLOP reduction target=3x2022.08 | 75.01 | |
| SPOSParams(M)=4.32020.06 | 75 | |
| Hybrid ViT-BBackbone=Hybrid ViT-B2021.11 | 74.94 | |
| GMPModel=ResNet50, FLOP reduction target=2x2022.08 | 74.86 | |
| ReSSLEpochs=200, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 74.7 | |
| WCLEpochs=800, Multi-crop=true, Evaluation protocol=linear evaluation2021.11 | 74.7 | |
| Distill on real imagesTeacher Network=ResNet-101, Teacher Accuracy=77.37%, Student Network=DeiT-Ti, Dataset Partition=ImageNet2022.04 | 74.6 | |
| ALABackbone=NASNet-A, length=2002023.10 | 74.6 |