Image Classification on 11 Datasets
96.2Accuracy (CIFAR-10)StableRep
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| StableRepPre-training Image Source=Syn, Pre-training Dataset=CC12M, Backbone=ViT-B/16, Evaluation Protocol=Linear probing, Pre-training Epochs=352023.06 | 96.2 | 84.1 | 58.3 | 80.9 | 78.1 | 97.2 | 87.5 | 73 | 94.6 | 83.6 | 87.2 | 83.7 | |
| CLIPPre-training Image Source=Real, Pre-training Dataset=CC12M, Backbone=ViT-B/16, Evaluation Protocol=Linear probing, Pre-training Epochs=352023.06 | 94 | 79 | 53.2 | 75.8 | 75.7 | 96 | 86.7 | 72.5 | 92.7 | 81.6 | 86.1 | 81.2 | |
| SimCLRPre-training Image Source=Real, Pre-training Dataset=CC12M, Backbone=ViT-B/16, Evaluation Protocol=Linear probing, Pre-training Epochs=352023.06 | 88.3 | 70.3 | 47.1 | 45.5 | 76.2 | 92.5 | 70.1 | 65.4 | 83.8 | 75 | 81.2 | 72.3 | |
| CLIPPre-training Image Source=Syn, Pre-training Dataset=CC12M, Backbone=ViT-B/16, Evaluation Protocol=Linear probing, Pre-training Epochs=352023.06 | 87.3 | 69.5 | 53.5 | 79.5 | 75.8 | 95.4 | 85.8 | 69.2 | 90.9 | 78.3 | 84.5 | 79.1 | |
| SimCLRPre-training Image Source=Syn, Pre-training Dataset=CC12M, Backbone=ViT-B/16, Evaluation Protocol=Linear probing, Pre-training Epochs=352023.06 | 84.8 | 65.2 | 51 | 53.2 | 74.5 | 93.3 | 74.2 | 65 | 81.7 | 74.8 | 81.8 | 72.7 |