Image Classification on 11 Downstream Classification Datasets (Collection)
78.8Average AccuracyPyramidCLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| PyramidCLIPPretrain Dataset=143M, Backbone=ResNet-50, Evaluation Protocol=End-to-end fine-tuning2022.04 | 78.8 | |
| cross-modal partial finetuningTemplate=HandEngineered, Number of shots=162023.01 | 78.6 | |
| cross-modal partial finetuningTemplate=Template Mining (21 views), Number of shots=162023.01 | 78.37 | |
| cross-modal partial finetuningTemplate=a photo of a {cls}., Number of shots=162023.01 | 78.34 | |
| Supervised(IN1K)Pretrain Dataset=1.2M, Backbone=ResNet-50, Evaluation Protocol=End-to-end fine-tuning2022.04 | 78.1 | |
| cross-modal partial finetuningTemplate=Class name, Number of shots=162023.01 | 77.73 | |
| cross-modal linear probingTemplate=HandEngineered, Number of shots=162023.01 | 77.21 | |
| cross-modal linear probingTemplate=Template Mining (21 views), Number of shots=162023.01 | 77.15 | |
| CLIP*Pretrain Dataset=400M, Backbone=ResNet-50, Evaluation Protocol=End-to-end fine-tuning2022.04 | 77 | |
| cross-modal linear probingTemplate=a photo of a {cls}., Number of shots=162023.01 | 76.85 | |
| ProDATemplate=36 Learned Templates, Number of shots=162023.01 | 76.78 | |
| cross-modal linear probingTemplate=Class name, Number of shots=162023.01 | 76.66 | |
| cross-modal partial finetuningTemplate=Template Mining (21 views), Number of shots=82023.01 | 74.9 | |
| cross-modal partial finetuningTemplate=HandEngineered, Number of shots=82023.01 | 74.83 | |
| cross-modal partial finetuningTemplate=a photo of a {cls}., Number of shots=82023.01 | 74.68 | |
| cross-modal partial finetuningTemplate=Class name, Number of shots=82023.01 | 74.22 | |
| ProDATemplate=36 Learned Templates, Number of shots=82023.01 | 74.21 | |
| cross-modal linear probingTemplate=Template Mining (21 views), Number of shots=82023.01 | 74.17 | |
| cross-modal linear probingTemplate=HandEngineered, Number of shots=82023.01 | 73.77 | |
| cross-modal linear probingTemplate=a photo of a {cls}., Number of shots=82023.01 | 73.75 | |
| cross-modal linear probingTemplate=Class name, Number of shots=82023.01 | 73.29 | |
| ProDATemplate=36 Learned Templates, Number of shots=42023.01 | 71.49 | |
| cross-modal partial finetuningTemplate=HandEngineered, Number of shots=42023.01 | 71.1 | |
| cross-modal partial finetuningTemplate=Template Mining (21 views), Number of shots=42023.01 | 71.04 | |
| cross-modal linear probingTemplate=Template Mining (21 views), Number of shots=42023.01 | 71 | |
| cross-modal linear probingTemplate=HandEngineered, Number of shots=42023.01 | 70.97 | |
| cross-modal linear probingTemplate=a photo of a {cls}., Number of shots=42023.01 | 70.71 | |
| cross-modal partial finetuningTemplate=a photo of a {cls}., Number of shots=42023.01 | 70.59 | |
| cross-modal partial finetuningTemplate=Class name, Number of shots=42023.01 | 70.29 | |
| cross-modal linear probingTemplate=Class name, Number of shots=42023.01 | 69.95 | |
| CoCoOpLearnable=true2022.03 | 69.13 | |
| ProDATemplate=36 Learned Templates, Number of shots=22023.01 | 68.59 | |
| cross-modal partial finetuningTemplate=HandEngineered, Number of shots=22023.01 | 68.05 | |
| cross-modal partial finetuningTemplate=Template Mining (21 views), Number of shots=22023.01 | 68.03 | |
| cross-modal linear probingTemplate=Template Mining (21 views), Number of shots=22023.01 | 67.62 | |
| cross-modal partial finetuningTemplate=a photo of a {cls}., Number of shots=22023.01 | 67.48 | |
| cross-modal linear probingTemplate=HandEngineered, Number of shots=22023.01 | 67.31 | |
| cross-modal linear probingTemplate=a photo of a {cls}., Number of shots=22023.01 | 66.59 | |
| cross-modal partial finetuningTemplate=Class name, Number of shots=22023.01 | 66.46 | |
| cross-modal linear probingTemplate=Class name, Number of shots=22023.01 | 65.75 | |
| CoOpLearnable=true2022.03 | 65.55 | |
| CLIPLearnable=false2022.03 | 65.22 | |
| ProDATemplate=36 Learned Templates, Number of shots=12023.01 | 65.19 | |
| cross-modal partial finetuningTemplate=HandEngineered, Number of shots=12023.01 | 65.01 | |
| cross-modal partial finetuningTemplate=Template Mining (21 views), Number of shots=12023.01 | 64.89 | |
| cross-modal linear probingTemplate=HandEngineered, Number of shots=12023.01 | 64.52 | |
| cross-modal partial finetuningTemplate=a photo of a {cls}., Number of shots=12023.01 | 64.38 | |
| cross-modal linear probingTemplate=Template Mining (21 views), Number of shots=12023.01 | 64.37 | |
| cross-modal linear probingTemplate=a photo of a {cls}., Number of shots=12023.01 | 63.87 | |
| cross-modal partial finetuningTemplate=Class name, Number of shots=12023.01 | 62.58 | |
| cross-modal linear probingTemplate=Class name, Number of shots=12023.01 | 62.34 |