Zero-shot Image Classification on ImageNet (val)
80.1AccuracyEnsemble Teacher
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ensemble TeacherTraining Dataset=DataComp-1B [18], OpenAI-400M [47], Image Encoder=ViT-L/14, Text Encoder=Base2023.11 | 80.1 | — | |
| MobileCLIP-B (LT)Training Dataset=DataCompDR-1B, Seen Samples=39B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.3 + 63.4, Latency (ms)=10.4 + 3.32023.11 | 77.2 | — | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.3 + 63.4, Latency (ms)=10.4 + 3.32023.11 | 76.8 | — | |
| DFN-B/16Training Dataset=DFN-2B [16], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 76.2 | — | |
| SigLIP-B/16Training Dataset=Webli-1B, Seen Samples=40B, Image Encoder=ViT-B/16, Text Encoder=Custom, Params (M)=92.9 + 110.3, Latency (ms)=9.9 + 5.82023.11 | 76 | — | |
| EVA02-B/16Training Dataset=Merged-2B [55], Seen Samples=8B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.42023.11 | 74.7 | — | |
| MobileCLIP-S2Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi2, Text Encoder=Base, Params (M)=35.7 + 63.4, Latency (ms)=3.6 + 3.32023.11 | 74.4 | — | |
| DataComp-B/16Training Dataset=DataComp-1B [18], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 73.5 | — | |
| DataComp-B/32-256Training Dataset=DataComp-1B [18], Seen Samples=34B, Image Encoder=ViT-B/32-256, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=6.2 + 3.32023.11 | 72.8 | — | |
| MobileCLIP-S1Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi1, Text Encoder=Base, Params (M)=21.5 + 63.4, Latency (ms)=2.5 + 3.32023.11 | 72.6 | — | |
| LAION-B/16Training Dataset=LAION-2B [52], Seen Samples=34B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 70.2 | — | |
| DataComp-B/32Training Dataset=DataComp-1B [18], Seen Samples=13B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 69.2 | — | |
| OpenAI-B/16Training Dataset=WIT-400M [47], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 68.3 | — | |
| MobileCLIP-S0Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi0, Text Encoder=MCt, Params (M)=11.4 + 42.4, Latency (ms)=1.5 + 1.62023.11 | 67.8 | — | |
| LAION-B/32Training Dataset=LAION-2B [52], Seen Samples=32B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 65.7 | — | |
| VeCLIP-B/16Training Dataset=WIT-200M, Seen Samples=6.4B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 64.6 | — | |
| TinyCLIP-63M/32Training Dataset=LAION-400M [51], YFCC-15M [57], Seen Samples=15.8B, Image Encoder=ViT-63M/32, Text Encoder=Custom2023.11 | 64.5 | — | |
| OpenAI-B/32Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 63.3 | — | |
| TinyCLIP-61M/32Training Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ViT-61M/32, Text Encoder=Custom, Params (M)=61.4 + 54.0, Latency (ms)=4.3 + 2.62023.11 | 62.4 | — | |
| OpenAI-RN101Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ResNet-101, Text Encoder=Base, Params (M)=56.3 + 63.4, Latency (ms)=4.3 + 3.32023.11 | 62.3 | — | |
| TinyCLIP-40M/32Training Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ViT-40M/32, Text Encoder=Custom, Params (M)=39.7 + 44.5, Latency (ms)=3.0 + 1.92023.11 | 59.8 | — | |
| OpenAI-RN50Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ResNet-50, Text Encoder=Base, Params (M)=38.3 + 63.4, Latency (ms)=3.3 + 3.32023.11 | 59.8 | — | |
| TinyCLIP-RN30MTraining Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ResNet-30M, Text Encoder=Custom, Params (M)=29.6 + 54.2, Latency (ms)=2.6 + 2.62023.11 | 59.1 | — | |
| TinyCLIP-RN19MTraining Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ResNet-19M, Text Encoder=Custom, Params (M)=18.6 + 44.8, Latency (ms)=1.9 + 1.92023.11 | 56.3 | — | |
| CLIPTraining Dataset=OpenAI-400M, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 68.3 | |
| CLIPTraining Dataset=LAION-2B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 70.2 | |
| CLIPTraining Dataset=DataComp-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 73.5 | |
| CLIPTraining Dataset=DFN-2B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 76.2 | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 76.8 | |
| SigLIPTraining Dataset=Webli-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | 76 |