Image Classification on 10 Downstream Classification Datasets
86.2Average AccuracyCLIP*
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CLIP*Image Encoder=ViT-B/16, Pretrain Dataset Size=400M, Evaluation Protocol=Linear probe2022.04 | 86.2 | — | — | — | — | — | — | — | — | — | — | |
| PyramidCLIPImage Encoder=ViT-B/16, Pretrain Dataset Size=143M, Evaluation Protocol=Linear probe2022.04 | 85.3 | — | — | — | — | — | — | — | — | — | — | |
| PyramidCLIPImage Encoder=ViT-B/32, Pretrain Dataset Size=143M, Evaluation Protocol=Linear probe2022.04 | 82.8 | — | — | — | — | — | — | — | — | — | — | |
| CLIP*Image Encoder=ViT-B/32, Pretrain Dataset Size=400M, Evaluation Protocol=Linear probe2022.04 | 82.7 | — | — | — | — | — | — | — | — | — | — | |
| FFF-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 79.2 | 93.9 | 78.4 | 80.3 | 84.9 | 94.7 | 96.2 | 55.5 | 72.2 | 99.9 | 36.5 | |
| ALIP-VIT-B/32Backbone=ViT-B/32, Pre-train Dataset=YFCC15M, Evaluation Protocol=Linear Probe2023.08 | 72.2 | 94.3 | 77.8 | 75.8 | 76 | 95.1 | 73.3 | 33.6 | 71.7 | 88.5 | 36.1 | |
| ALIP-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 72.2 | 94.3 | 77.8 | 75.8 | 76 | 95.1 | 73.3 | 33.6 | 71.7 | 88.5 | 36.1 | |
| HIDECLIP-VIT-B/32Backbone=ViT-B/32, Pre-train Dataset=YFCC15M, Evaluation Protocol=Linear Probe2023.08 | 70.8 | 88.1 | 70.7 | 77.6 | 75.5 | 95.6 | 72.2 | 36 | 70.1 | 90 | 32.6 | |
| HiDeCLIP-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 70.8 | 88.1 | 70.7 | 77.6 | 75.5 | 95.6 | 72.2 | 36 | 70.1 | 90 | 32.6 | |
| DECLIP-VIT-B/32Backbone=ViT-B/32, Pre-train Dataset=YFCC15M, Evaluation Protocol=Linear Probe2023.08 | 68.7 | 89.2 | 69 | 75.4 | 72.2 | 94.4 | 71.6 | 31 | 68.8 | 87.9 | 27.6 | |
| DeCLIP-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 68.7 | 89.2 | 69 | 75.4 | 72.2 | 94.4 | 71.6 | 31 | 68.8 | 87.9 | 27.6 | |
| HICLIP-VIT-B/32Backbone=ViT-B/32, Pre-train Dataset=YFCC15M, Evaluation Protocol=Linear Probe2023.08 | 67.2 | 89.5 | 71.1 | 73.5 | 70.6 | 91.9 | 68.8 | 30.8 | 63.9 | 84.8 | 27.4 | |
| HiCLIP-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 67.2 | 89.5 | 71.1 | 73.5 | 70.6 | 91.9 | 68.8 | 30.8 | 63.9 | 84.8 | 27.4 | |
| CLIP-VIT-B/32Backbone=ViT-B/32, Pre-train Dataset=YFCC15M, Evaluation Protocol=Linear Probe2023.08 | 63 | 86.5 | 64.7 | 69.2 | 64.6 | 90.6 | 66 | 24.9 | 61.3 | 79.1 | 23.1 | |
| CLIP-ViT-B/32Evaluation Protocol=Linear Probe, Pre-train dataset=YFCC15M2024.05 | 63 | 86.5 | 64.7 | 69.2 | 64.6 | 90.6 | 66 | 24.9 | 61.3 | 79.1 | 23.1 |