Image Classification on Let It Wag!
52Top-1 AccuracyDynamiCS
Evaluation Results
| Method | Links | |
|---|---|---|
| DynamiCSDataset (Data Size)=DataComp-DFN (130M), Samples Seen@Resolution=2.56B@112 + 128M@224, Tokens=81, GPU-hours=299, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 52 | |
| DynamiCSDataset (Data Size)=DataComp-DFN (130M), Samples Seen@Resolution=1.28B@112 + 128M@224, Tokens=81, GPU-hours=163, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 50.2 | |
| LaCLIPDataset (Data Size)=(400M), Samples Seen@Resolution=12.8B@224, Tokens=274, GPU-hours=≈ 10700, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 48.4 | |
| MetaCLIP-400MDataset (Data Size)=(400M), Samples Seen@Resolution=12.8B@224, Tokens=274, GPU-hours=≈ 10700, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 46.5 | |
| DynamiCSDataset (Data Size)=LAION-400M (298M), Samples Seen@Resolution=2.56B@112 + 128M@224, Tokens=81, GPU-hours=299, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 45.5 | |
| CLIPA + DynamiCSDataset (Data Size)=LAION-400M (298M), Samples Seen @Resolution=1.28B@112 + 128M@224, Encoder=ViT-L/16, GPU hour=300, Zero-shot=true2026.04 | 44.5 | |
| OpenCLIPDataset (Data Size)=LAION-400M (400M), Samples Seen@Resolution=12.8B@224, Tokens=274, GPU-hours=10736, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 39.1 | |
| OpenAI-WITDataset (Data Size)=(400M), Samples Seen@Resolution=12.8B@224, Tokens=274, GPU-hours=10700, Zero-shot=true, Image Encoder=ViT-B/162026.04 | 37.9 |