Image Classification on VOC 2007 (top-1 accuracy)
92.6Top-1 AccuracyCaCo
Evaluation Results
| Method | Links | |
|---|---|---|
| CaCoBackbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 92.6 | |
| AdCo +Backbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 92.4 | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 87.9 | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 87.4 | |
| MoCo v2+Backbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 87.1 | |
| CLIPBackbone=ResNet-50, Evaluation Protocol=Linear probe2021.06 | 87.1 | |
| EVA-CLIP-18BZero-shot=true2024.02 | 85.8 | |
| EVA-01-CLIP-g/14Zero-shot=true2024.02 | 85.7 | |
| EsViTBackbone=Swin-T, Evaluation Protocol=Linear probe2021.06 | 85.5 | |
| BYOLEvaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 85.4 | |
| ViC-MAEBackbone=ViT/L-16, Pre-training=K710+MiT+IN1K, Evaluation Protocol=Linear Evaluation2023.03 | 85.3 | |
| EVA-CLIP-8BZero-shot=true2024.02 | 85.1 | |
| ViC-MAEBackbone=ViT/B-16, Pre-training=MiT, Evaluation Protocol=Linear Evaluation2023.03 | 84.77 | |
| FNCEvaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 84.7 | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 84.7 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 84.5 | |
| SupervisedBackbone=Swin-T, Evaluation Protocol=Linear probe2021.06 | 84.2 | |
| ViC-MAEBackbone=ViT/L-16, Pre-training=IN1K+K400, Evaluation Protocol=Linear Evaluation2023.03 | 84.2 | |
| SimCLR v1Evaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 84.1 | |
| SimCLR v2Evaluation Protocol=Fine-tuned, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 84.1 | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 84.1 | |
| SupervisedBackbone=ResNet-50, Evaluation Protocol=Linear probe2021.06 | 83.8 | |
| ViC-MAEBackbone=ViT/B-16, Pre-training=K400, Evaluation Protocol=Linear Evaluation2023.03 | 83.74 | |
| SupervisedBackbone=ResNet-50, Evaluation Protocol=Linear probe, Reproduced=true2021.06 | 83.6 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 83.5 | |
| MAEBackbone=ViT/B-16, Pre-training=MiT, Evaluation Protocol=Linear Evaluation2023.03 | 83.46 | |
| MAEBackbone=ViT/L-16, Pre-training=IN1K, Evaluation Protocol=Linear Evaluation2023.03 | 83.3 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 83.3 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 83.1 | |
| MAEBackbone=ViT/B-16, Pre-training=K400, Evaluation Protocol=Linear Evaluation2023.03 | 83.07 | |
| FNCEvaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 83 | |
| NNCLRBackbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 83 | |
| OmniMAEBackbone=ViT/L-16, Pre-training=SSv2+IN1K, Evaluation Protocol=Linear Evaluation2023.03 | 82.7 | |
| BYOLEvaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 82.5 | |
| BYOLBackbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 82.5 | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 81.9 | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 81.5 | |
| SimCLRBackbone=ResNet-50, Pre-training Dataset=ImageNet-1K, Pre-training Epochs=8002022.03 | 81.4 | |
| SimCLR v2Evaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 81.2 | |
| SimCLR v1Evaluation Protocol=Linear eval, Backbone=ResNet, Pre-training Dataset=ImageNet2020.11 | 80.5 | |
| InternVL-CZero-shot=true2024.02 | 80 | |
| OpenCLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 78.8 | |
| CLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 78 | |
| CLIP-MapbaseImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 77 | |
| TinyCLIPImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 76.9 | |
| CLIP-MapsmallImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 68.5 | |
| Standard CLIPEvaluation Protocol=zero-shot2024.11 | 65 | |
| Text2ConceptEvaluation Protocol=zero-shot2024.11 | 65 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 63 | |
| B-cosified RN-50 CLIPPre-training Dataset=ImageNet [16], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 62 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cosine, Evaluation Protocol=zero-shot2024.11 | 62 | |
| †TinyCLIPImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 62 | |
| B-cosified RN-50 CLIPPre-training Dataset=CC3M [47], Learning Scheduler=Cyclic, Evaluation Protocol=zero-shot2024.11 | 61 | |
| IL-CLIPPre-training Dataset=CC12M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 60 | |
| Codebook-CLIPPre-training Dataset=CC12M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 55.5 | |
| NegCLIPPre-training Dataset=CC12M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 54.1 | |
| CLIPPre-training Dataset=CC12M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 53.3 | |
| Codebook-CLIPPre-training Dataset=CC3M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 48.3 | |
| IL-CLIPPre-training Dataset=CC3M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 48.3 | |
| NegCLIPPre-training Dataset=CC3M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 44.6 | |
| †TinyCLIPImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 44.6 | |
| CLIPPre-training Dataset=CC3M, Backbone=ViT-B/32, Zero-shot=true2024.04 | 44.3 | |
| IL-CLIPPre-trained=DataComp-10M, Evaluation Protocol=zero-shot2024.04 | 42 | |
| ITOBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 38.9 | |
| CLIP-MaptinyImage Encoder=ViT-0.8M/16, Zero-shot=true2026.02 | 38.6 | |
| ITO sub2Backbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 38.3 | |
| Codebook-CLIPPre-trained=DataComp-10M, Evaluation Protocol=zero-shot2024.04 | 38 | |
| CLIPBackbone=ViT-L/16, Pre-training Dataset=DataComp-1B, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 37.2 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 36.2 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 35.8 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 34.9 | |
| SLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 33.2 | |
| CLIPPre-trained=DataComp-10M, Evaluation Protocol=zero-shot2024.04 | 32 | |
| NegCLIPPre-trained=DataComp-10M, Evaluation Protocol=zero-shot2024.04 | 32 | |
| ITO sub2Pre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 30.4 | |
| FLAIRPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 29.6 | |
| ITOPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 27.7 | |
| SigLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 27.5 | |
| SLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 27.2 | |
| FLAIRPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 25.2 | |
| CLIPPre-training Dataset=CC12M, Backbone=ViT-B/16, Epochs=30, Evaluation protocol=Zero-shot2026.03 | 24.2 | |
| ITOPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 21.9 | |
| ITO sub2Pre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 21.4 | |
| CLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 18.5 | |
| SigLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 16.6 |