Discrimination task 256 shape-color combinations (train)
100Train AccuracyCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIPBackbone=ViT-B/16, Pretraining Scale=400M2024.06 | 100 | |
| DINOv2Backbone=ViT-B/16, Pretraining Scale=142M2024.06 | 100 | |
| ImageNetBackbone=ViT-B/16, Pretraining Scale=14.2M2024.06 | 100 | |
| DINOBackbone=ViT-B/16, Pretraining Scale=1.28M2024.06 | 100 | |
| MAEBackbone=ViT-B/16, Pretraining Scale=1.28M2024.06 | 100 | |
| ViT-B/16 (No pre-training)Backbone=ViT-B/16, Pretraining Scale=None2024.06 | 95.9 |