Zero-shot Image Classification on ImageNet 1K (val)
78.1AccuracyREACT (Locked-Text Gated-Image)
Evaluation Results
| Method | Links | |
|---|---|---|
| REACT (Locked-Text Gated-Image)Backbone=ViT-L/14, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 78.1 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-L/14, Pretrain Data=LAION-2B, Evaluation Protocol=Zero-shot2023.01 | 76.4 | |
| SigLIPBackbone=ViT-B/162026.03 | 76.1 | |
| SigLIPBackbone=ViT-B/16, Fine-tuning Dataset=CC3M, Method Category=Models fine-tuned by us2026.03 | 75.9 | |
| CLIPBackbone=ViT-L/14, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 75.3 | |
| OpenCLIPBackbone=ViT-L/14, Pretrain Data=LAION-2B, Evaluation Protocol=Zero-shot2023.01 | 75.3 | |
| C2LIPMethod Category=Models fine-tuned by us2026.03 | 73.5 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-B/16, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 73.4 | |
| REACT (Locked-Text)Backbone=ViT-B/16, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 71.6 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-B/16, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 70.5 | |
| REACT (Locked-Text)Backbone=ViT-B/16, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 69.9 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-B/32, Pretrain Data=LAION-2B, Evaluation Protocol=Zero-shot2023.01 | 69.5 | |
| FG-CLIPMethod Category=Fine-grained models2026.03 | 69 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-B/32, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 68.6 | |
| CLIPBackbone=ViT-B/16, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 68.6 | |
| CLIP (OpenAI)Backbone=ViT-B/162026.03 | 68.4 | |
| REACT (Locked-Text)Backbone=ViT-B/32, Pretrain Data=LAION-2B, Evaluation Protocol=Zero-shot2023.01 | 67.5 | |
| OpenCLIPBackbone=ViT-B/16, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 67.1 | |
| REACT (Locked-Text)Backbone=ViT-B/32, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 66.9 | |
| OpenCLIPBackbone=ViT-B/32, Pretrain Data=LAION-2B, Evaluation Protocol=Zero-shot2023.01 | 66.6 | |
| CLICMethod Category=Composition-aware models2026.03 | 66.6 | |
| REACT (Locked-Text Gated-Image)Backbone=ViT-B/32, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 66.4 | |
| REACT (Locked-Text)Backbone=ViT-B/32, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 65.7 | |
| CLIP-MapbaseDataset=YFCC-15M, Seen Samples=0.30B, Params (img+txt)=39 + 192026.02 | 63.7 | |
| CoN-CLIPMethod Category=Composition-aware models2026.03 | 63.7 | |
| TinyCLIP-39M/16Dataset=YFCC-15M, Seen Samples=0.75B, Params (img+txt)=39 + 192026.02 | 63.5 | |
| CLIP (OpenAI)Backbone=ViT-B/322026.03 | 63.3 | |
| CLIPBackbone=ViT-B/32, Pretrain Data=WIT-400M, Evaluation Protocol=Zero-shot2023.01 | 63.2 | |
| OpenCLIPBackbone=ViT-B/32, Pretrain Data=LAION-400M, Evaluation Protocol=Zero-shot2023.01 | 62.9 | |
| LLIPMethod Category=Fine-grained models2026.03 | 60.8 | |
| MoPE-CLIPbaseDataset=YFCC-15M, Seen Samples=0.30B, Params (img+txt)=86 + 422026.02 | 60.7 | |
| SLVC-RLMethod Category=Composition-aware models2026.03 | 59.7 | |
| MobileCLIP-S0Dataset=DataCompDR-12M, Seen Samples=0.74B, Params (img+txt)=11.4 + 42.42026.02 | 59.1 | |
| SLVC-RMethod Category=Composition-aware models2026.03 | 58.5 | |
| FineCLIPMethod Category=Fine-grained models2026.03 | 55.8 | |
| NegCLIPMethod Category=Composition-aware models2026.03 | 55.7 | |
| DAC-SAMMethod Category=Composition-aware models2026.03 | 52.3 | |
| DAC-LLMMethod Category=Composition-aware models2026.03 | 51.1 | |
| TripletCLIPMethod Category=Composition-aware models2026.03 | 45.9 | |
| CLIP-MapsmallDataset=YFCC-15M, Seen Samples=0.45B, Params (img+txt)=8 + 32026.02 | 42.7 | |
| ViT-T/16Dataset=CC3M + CC12M, Seen Samples=0.48B, Params (img+txt)=5.6 + 21.32026.02 | 42.6 | |
| †TinyCLIP-8M/16Dataset=YFCC-15M, Seen Samples=0.75B, Params (img+txt)=8 + 32026.02 | 41.1 | |
| CE-CLIPMethod Category=Composition-aware models2026.03 | 40.4 | |
| FLAIR-3mMethod Category=Fine-grained models2026.03 | 33.7 | |
| DreamLIP-3mMethod Category=Fine-grained models2026.03 | 31.6 | |
| CLIP-MaptinyDataset=YFCC-15M, Seen Samples=0.45B, Params (img+txt)=0.8 + 0.32026.02 | 19 | |
| †TinyCLIP-0.8M/16Dataset=YFCC-15M, Seen Samples=1.125B, Params (img+txt)=0.8 + 0.32026.02 | 16.6 | |
| Codebook-CLIPMethod Category=Codebook-based models2026.03 | 0 | |
| IL-CLIPMethod Category=Codebook-based models2026.03 | 0 |