Image Classification on ImageNet-1K (accuracy)
94.2AccuracyCE-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| CE-CLIPEvaluation Protocol=Linear Probing2023.06 | 94.2 | |
| CLIPEvaluation Protocol=Linear Probing2023.06 | 93.2 | |
| CLIP-FTEvaluation Protocol=Fine-tuned on COCO + Linear Probing2023.06 | 92.8 | |
| CE-CLIP+Evaluation Protocol=Linear Probing2023.06 | 92.7 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Finetuning2024.07 | 87.1 | |
| dBOTBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 87.1 | |
| dBOT-RefinedBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 87.1 | |
| MAE-RefinedBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.9 | |
| MAE-CTBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.8 | |
| D2V2-RefinedBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.8 | |
| D2V2-RefinedBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.7 | |
| MAEBackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.7 | |
| D2V2Backbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.6 | |
| D2V2Backbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 86.6 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Finetuning2024.07 | 86.2 | |
| RADIO-ViT-H/16Params (M)=653, Resolution=432, Throughput=158, Protocol=k-NN2023.12 | 86.06 | |
| dBOT-RefinedBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.9 | |
| LiT-22B2026.02 | 85.9 | |
| dBOTBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.8 | |
| MAEBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.7 | |
| MAE-RefinedBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.6 | |
| MAE-CTBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.4 | |
| IndividualBackbone=BEiT3-base2024.05 | 85.37 | |
| DFN CLIP-H/14Params (M)=633, Resolution=378, Throughput=170, Protocol=k-NN2023.12 | 85.27 | |
| MugsBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.2 | |
| SigLIP-L/14Params (M)=428, Resolution=384, Throughput=241, Protocol=k-NN2023.12 | 85.16 | |
| CrossMAE-RefinedBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 85.1 | |
| CrossMAEBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 84.9 | |
| I-JEPABackbone=ViT-H/14, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 84.9 | |
| iBOTBackbone=ViT-L/16, Evaluation Protocol=Full fine-tuning (100% labels)2024.02 | 84.8 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probing2024.07 | 84.6 | |
| iBOT-vMFBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 84.1 | |
| iBOTBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 84 | |
| DFN CLIP-H/14Params (M)=633, Resolution=378, Throughput=170, Protocol=Zero-shot2023.12 | 83.9 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probing2024.07 | 83.9 | |
| E-RADIO-LParams (M)=391, Resolution=512, Throughput=468, Protocol=k-NN2023.12 | 83.89 | |
| Random (DeIT-III)Backbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 83.8 | |
| DINOBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 83.6 | |
| DINO-vMFBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 83.6 | |
| MAEBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 83.6 | |
| MAEPre-training Dataset=IN-1K(~ 1.3M), Pre-training Epochs=1600, Evaluation Protocol=End-to-end fine-tuning2023.01 | 83.6 | |
| RILSPre-training Dataset=L-50M, Pre-training Epochs=25(~ 1000), Evaluation Protocol=End-to-end fine-tuning2023.01 | 83.6 | |
| DINOv2-g/14-regParams (M)=1137, Resolution=224, Throughput=294, Protocol=k-NN2023.12 | 83.41 | |
| BeITBackbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 83.4 | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 83.33 | |
| RILSPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 83.3 | |
| Intern-ViT-6BParams (M)=5902, Resolution=224, Throughput=63, Protocol=Zero-shot2023.12 | 83.2 | |
| BEiTPre-training Dataset=IN-1K(~ 1.3M), Pre-training Epochs=800, Evaluation Protocol=End-to-end fine-tuning2023.01 | 83.2 | |
| VISRegBackbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 83 | |
| RADIO-ViT-H/16Params (M)=653, Resolution=432, Throughput=158, Protocol=Zero-shot2023.12 | 82.93 | |
| MetaCLIP+ViSE2026.02 | 82.914 | |
| Only ViSE2026.02 | 82.914 | |
| MAE+CLIPPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 82.9 | |
| DINOBackbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 82.8 | |
| CLIPPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 82.7 | |
| SigLIP-L/14Params (M)=428, Resolution=384, Throughput=241, Protocol=Zero-shot2023.12 | 82.61 | |
| SLIPPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 82.6 | |
| Ours-RLFTTraining Phase=Alignment fine-tuning, Evaluation Protocol=Zero-shot2024.06 | 82.2 | |
| KD 2B to ViT-H, ViseBackbone=ViT-H, Distillation=KD 2B, Target=Vise2026.02 | 82.2 | |
| MetaCLIP-H/14Params (M)=632, Resolution=224, Throughput=486, Protocol=k-NN2023.12 | 82.12 | |
| Ours-PTTraining Phase=Pre-training, Evaluation Protocol=Zero-shot2024.06 | 82.1 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probing2024.07 | 82.1 | |
| MAEPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 82.1 | |
| Random (DeIT)Backbone=ViT-Base/16, Pre-training=ImageNet-1K, Evaluation Protocol=Fine-tuning2024.05 | 81.8 | |
| DataComp + RLFTTraining Phase=Alignment fine-tuning, Evaluation Protocol=Zero-shot2024.06 | 81.7 | |
| Sup.Backbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 81.5 | |
| SimCLRPre-training Dataset=L-20M, Pre-training Epochs=25(~ 400), Evaluation Protocol=End-to-end fine-tuning2023.01 | 81.3 | |
| OpenCLIP-H/14Params (M)=632, Resolution=224, Throughput=503, Protocol=k-NN2023.12 | 81.1 | |
| SuperCLIPPretrain=L-512M, Evaluation Protocol=Linear Probing2025.12 | 81 | |
| E-RADIO-LParams (M)=391, Resolution=512, Throughput=468, Protocol=Zero-shot2023.12 | 80.73 | |
| MetaCLIP-H/14Params (M)=632, Resolution=224, Throughput=486, Protocol=Zero-shot2023.12 | 80.51 | |
| PACEBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K, Base Method=LoRA_mul + VPT_add2024.09 | 80.1 | |
| OpenAI CLIP-L/14Params (M)=305, Resolution=336, Throughput=414, Protocol=k-NN2023.12 | 79.8 | |
| CLIPPretrain=L-512M, Evaluation Protocol=Linear Probing2025.12 | 79.7 | |
| PACEBackbone=Swin-B, Pre-training=ImageNet-21K, Base Method=LoRA_mul + VPT_add2024.09 | 79.6 | |
| CLIP + RLFTTraining Phase=Alignment fine-tuning, Evaluation Protocol=Zero-shot2024.06 | 79.4 | |
| DataCompTraining Phase=Pre-training, Evaluation Protocol=Zero-shot2024.06 | 79.2 | |
| Linear ProbingBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 79.2 | |
| PACEBackbone=ViT-B, Pre-training=ImageNet-21K, Base Method=LoRA_mul + VPT_add2024.09 | 79 | |
| Linear ProbingBackbone=Swin-B, Pre-training=ImageNet-21K2024.09 | 78.8 | |
| LoRA_mulBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 78.6 | |
| Intern-ViT-6BParams (M)=5902, Resolution=224, Throughput=63, Protocol=k-NN2023.12 | 78.43 | |
| VPT_addBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 78.4 | |
| PEcore BSize=B2026.02 | 78.4 | |
| LoRA_mul + VPT_addBackbone=ViT-B, Pre-training=ImageNet-21K2024.09 | 78.3 | |
| LoRA_mul + VPT_addBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 78.3 | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 78.2 | |
| LoRA_mulBackbone=ViT-B, Pre-training=ImageNet-21K2024.09 | 78.1 | |
| LoRA_add + VPT_addBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 78 | |
| LoRA_addBackbone=ViT-B, Pre-training=Laion2B-ImageNet-12K2024.09 | 77.5 | |
| EMR-MERGINGBackbone=BEiT3-base2024.05 | 77.42 | |
| SigLIP2-g-optSize=g2026.02 | 77.4 | |
| OpenCLIP-H/14Params (M)=632, Resolution=224, Throughput=503, Protocol=Zero-shot2023.12 | 77.19 | |
| SuperCLIPPretrain=B-512M, Evaluation Protocol=Linear Probing2025.12 | 77.1 | |
| LoRA_add + VPT_addBackbone=ViT-B, Pre-training=ImageNet-21K2024.09 | 76.8 | |
| LRWOpt2024.03 | 76.61 | |
| LoRA_mul + VPT_addBackbone=Swin-B, Pre-training=ImageNet-21K2024.09 | 76.6 | |
| PEcore GSize=G2026.02 | 76.5 | |
| LoRA_addBackbone=Swin-B, Pre-training=ImageNet-21K2024.09 | 76.3 | |
| LoRA_add + VPT_addBackbone=Swin-B, Pre-training=ImageNet-21K2024.09 | 76.3 |