Zero-shot Image Classification on ImageNet shift
69.6AccuracyEnsemble Teacher
Evaluation Results
| Method | Links | |
|---|---|---|
| Ensemble TeacherTraining Dataset=DataComp-1B [18], OpenAI-400M [47], Image Encoder=ViT-L/14, Text Encoder=Base2023.11 | 69.6 | |
| MobileCLIP-B (LT)Training Dataset=DataCompDR-1B, Seen Samples=39B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.3 + 63.4, Latency (ms)=10.4 + 3.32023.11 | 66.1 | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.3 + 63.4, Latency (ms)=10.4 + 3.32023.11 | 65.6 | |
| MobileCLIP-S2Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi2, Text Encoder=Base, Params (M)=35.7 + 63.4, Latency (ms)=3.6 + 3.32023.11 | 63.1 | |
| DFN-B/16Training Dataset=DFN-2B [16], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 62.3 | |
| SigLIP-B/16Training Dataset=Webli-1B, Seen Samples=40B, Image Encoder=ViT-B/16, Text Encoder=Custom, Params (M)=92.9 + 110.3, Latency (ms)=9.9 + 5.82023.11 | 61 | |
| DataComp-B/16Training Dataset=DataComp-1B [18], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 60.8 | |
| MobileCLIP-S1Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi1, Text Encoder=Base, Params (M)=21.5 + 63.4, Latency (ms)=2.5 + 3.32023.11 | 60.7 | |
| EVA02-B/16Training Dataset=Merged-2B [55], Seen Samples=8B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.42023.11 | 59.6 | |
| DataComp-B/32-256Training Dataset=DataComp-1B [18], Seen Samples=34B, Image Encoder=ViT-B/32-256, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=6.2 + 3.32023.11 | 58.7 | |
| LAION-B/16Training Dataset=LAION-2B [52], Seen Samples=34B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 56.6 | |
| OpenAI-B/16Training Dataset=WIT-400M [47], Seen Samples=13B, Image Encoder=ViT-B/16, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=11.5 + 3.32023.11 | 55.9 | |
| DataComp-B/32Training Dataset=DataComp-1B [18], Seen Samples=13B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 55.2 | |
| MobileCLIP-S0Training Dataset=DataCompDR-1B, Seen Samples=13B, Image Encoder=MCi0, Text Encoder=MCt, Params (M)=11.4 + 42.4, Latency (ms)=1.5 + 1.62023.11 | 55.1 | |
| LAION-B/32Training Dataset=LAION-2B [52], Seen Samples=32B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 51.9 | |
| TinyCLIP-61M/32Training Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ViT-61M/32, Text Encoder=Custom, Params (M)=61.4 + 54.0, Latency (ms)=4.3 + 2.62023.11 | 48.7 | |
| OpenAI-RN101Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ResNet-101, Text Encoder=Base, Params (M)=56.3 + 63.4, Latency (ms)=4.3 + 3.32023.11 | 48.5 | |
| OpenAI-B/32Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ViT-B/32, Text Encoder=Base, Params (M)=86.2 + 63.4, Latency (ms)=5.9 + 3.32023.11 | 48.5 | |
| TinyCLIP-40M/32Training Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ViT-40M/32, Text Encoder=Custom, Params (M)=39.7 + 44.5, Latency (ms)=3.0 + 1.92023.11 | 46.5 | |
| TinyCLIP-RN30MTraining Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ResNet-30M, Text Encoder=Custom, Params (M)=29.6 + 54.2, Latency (ms)=2.6 + 2.62023.11 | 45.7 | |
| OpenAI-RN50Training Dataset=OpenAI-400M [47], Seen Samples=13B, Image Encoder=ResNet-50, Text Encoder=Base, Params (M)=38.3 + 63.4, Latency (ms)=3.3 + 3.32023.11 | 45.1 | |
| TinyCLIP-RN19MTraining Dataset=LAION-400M [51], Seen Samples=15.2B, Image Encoder=ResNet-19M, Text Encoder=Custom, Params (M)=18.6 + 44.8, Latency (ms)=1.9 + 1.92023.11 | 43.6 |