Image Classification on Flowers (Top-1 Accuracy)
99.3Top-1 AccDC-ViT-B
Evaluation Results
| Method | Links | |
|---|---|---|
| DC-ViT-Blatency reduction=24.8%, compression=few-shot2024.03 | 99.3 | |
| Core-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 99.18 | |
| VISRegBackbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 99 | |
| EfficientNet-B72024.03 | 98.8 | |
| DINOBackbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 98.8 | |
| SL-CE-tuningBackbone=ResNet-50, Pre-training=Supervised ImageNet2021.02 | 98.78 | |
| RIFLEBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.7 | |
| L2SPBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.66 | |
| DELTABackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.65 | |
| SCLBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.65 | |
| M&MBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| BSSBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| Bi-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| ViT-B2024.03 | 98.5 | |
| Sup.Backbone=ViT-B/16, Evaluation Protocol=Fine-tuning2026.06 | 98.5 | |
| CE-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.49 | |
| FNCEvaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 97.5 | |
| DeiT-TGFLOPS=1.262023.05 | 97.3 | |
| SimCLR v2Evaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 97.2 | |
| SimCLR v1Evaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 97 | |
| BYOLEvaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 97 | |
| DST (FlexMatch)Pre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 96.4 | |
| BYOLEvaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 96.1 | |
| DST (FlexMatch)Pre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 95.8 | |
| DST (FixMatch)Pre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 95.6 | |
| Zero-TPGFLOPS=0.91, Backbone=DeiT-T2023.05 | 95.1 | |
| FNCEvaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 94.9 | |
| DST (FixMatch)Pre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 94.8 | |
| ATSGFLOPS=0.90, Backbone=DeiT-T2023.05 | 94.6 | |
| SimCLR v2Evaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 93.5 | |
| ToMeGFLOPS=0.90, Backbone=DeiT-T2023.05 | 93.2 | |
| MoCov3 + DATtraining_strategy=DAT2022.09 | 93.15 | |
| MoCov3training_strategy=baseline2022.09 | 91.54 | |
| SimCLR v1Evaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 91.2 | |
| SimCLR + DATtraining_strategy=DAT2022.09 | 90.14 | |
| SimCLRtraining_strategy=baseline2022.09 | 89.28 | |
| DoRA2026.04 | 87.87 | |
| BaselinePre-training=Unsupervised, Backbone=ResNet-50, Labels per category=42022.02 | 87.7 | |
| SimSiamtraining_strategy=baseline2022.09 | 87.67 | |
| SimSiam + DATtraining_strategy=DAT2022.09 | 86.93 | |
| PARA2026.04 | 86.03 | |
| BaselinePre-training=Supervised, Backbone=ResNet-50, Labels per category=42022.02 | 85.2 | |
| AdaLoRA2026.04 | 84.14 | |
| SoRA2026.04 | 83.41 | |
| LoRA2026.04 | 82.18 | |
| DINOEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 81.6 | |
| CARPEp=400, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 80.3 | |
| CARPEp=400, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 80 | |
| GoRA2026.04 | 79.8 | |
| MoCo-v3Ep=1000, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 79 | |
| Barlow TwinsEp=1000, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 78.8 | |
| TripletEp=980, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 77.7 | |
| WukongBackbone=Swin-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 76.9 | |
| DeepCluster-v2Ep=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 76.3 | |
| MGD3+EVLFBackbone=ConvNet-4, Pre-training Dataset=distilled ImageNet-1K subset (0.8x), Evaluation Protocol=Fine-tuning2026.03 | 76.03 | |
| SwAVEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 75.2 | |
| FILIPBackbone=Swin-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 75.1 | |
| LlipData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 74.9 | |
| MetaCLIPData Size=2.5B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 73.9 | |
| CLIPBackbone=ViT-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 72.3 | |
| CLIPBackbone=Swin-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 71 | |
| KRR-STBackbone=ConvNet-4, Pre-training Dataset=distilled ImageNet-1K subset (0.8x), Evaluation Protocol=Fine-tuning2026.03 | 70.45 | |
| OpenCLIPData Size=2B, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 69.8 | |
| FILIPBackbone=ViT-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 69.4 | |
| WukongBackbone=ViT-L, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 68.9 | |
| WukongBackbone=ViT-B, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 64.8 | |
| HiDeCLIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 64.1 | |
| DeFILIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 63.7 | |
| FFF-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 62.1 | |
| oBoWEp=200, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 61.9 | |
| InfoMinEp=800, k=20, Evaluation Protocol=k-NN, Multi-crop=false2023.10 | 61.9 | |
| HiCLIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 60.9 | |
| DeCLIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 60.8 | |
| w/o preBackbone=ConvNet-4, Evaluation Protocol=Fine-tuning2026.03 | 59.39 | |
| SeLa-v2Ep=400, k=20, Evaluation Protocol=k-NN, Multi-crop=true2023.10 | 58.6 | |
| RandomBackbone=ConvNet-4, Evaluation Protocol=Fine-tuning2026.03 | 56.81 | |
| ALIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 54.8 | |
| FILIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 52.7 | |
| CLIPBackbone=ViT-B, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 52.6 | |
| FRePoBackbone=ConvNet-4, Pre-training Dataset=distilled ImageNet-1K subset (0.8x), Evaluation Protocol=Fine-tuning2026.03 | 52.5 | |
| DreamLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 51.1 | |
| CLIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 50.1 | |
| SLIP-ViT-B/32Pre-train dataset=YFCC15M, Evaluation Protocol=Zero-shot, Architecture=ViT-B/322024.05 | 49 | |
| FILIPBackbone=ViT-B, Zero-shot=true, Pre-training Dataset=Wukong2022.02 | 48.8 | |
| FLAIRData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 48.4 | |
| SigLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 43.6 | |
| CLIPData Size=30M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 43.4 | |
| UNCHABackbone=ViT-B/16, Zero-shot=true2026.03 | 27 | |
| UNCHABackbone=ViT-S/16, Zero-shot=true2026.03 | 24.6 | |
| HyCoCLIPBackbone=ViT-B/16, Zero-shot=true2026.03 | 23.9 | |
| MERUBackbone=ViT-B/16, Zero-shot=true2026.03 | 21.6 | |
| CLIPw/ boxes=true2025.10 | 21.32 | |
| CLIPBackbone=ViT-B/16, Zero-shot=true2026.03 | 21.3 | |
| CLIPw/ boxes=false2025.10 | 21.16 | |
| HyCoCLIPBackbone=ViT-S/16, Zero-shot=true2026.03 | 20.5 | |
| MERUw/ boxes=false2025.10 | 19.98 | |
| PHyCLIPw/ boxes=true2025.10 | 19.98 | |
| HyCoCLIPw/ boxes=true2025.10 | 19.41 | |
| FLAIRData Size=3M, Vision Encoder=ViT-B/16, Evaluation Protocol=Zero-shot2024.12 | 19.1 | |
| BriVLZero-shot=true, Pre-training Dataset=Own dataset2022.02 | 18.4 |