Image Classification on ImageNet-Adversarial (val)
75.8Top-1 AccuracyALIGN
Evaluation Results
| Method | Links | |
|---|---|---|
| ALIGNzero-shot evaluation protocol=True2022.11 | 75.8 | |
| ZEROBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 75.15 | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=full image encoder tuning (Theta_i), Adaptation steps (t)=32024.05 | 73.71 | |
| EVA CLIP-gzero-shot evaluation protocol=True2022.11 | 73.6 | |
| OpenAI CLIP-Lzero-shot evaluation protocol=True2022.11 | 70.8 | |
| Zero-ShotBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 68.82 | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=prompt tuning (Theta_etx), Adaptation steps (t)=12024.05 | 65.45 | |
| ZEROBackbone=MaPLe2024.05 | 63.32 | |
| ZEROBackbone=CLIP-ViT-B-16, Ensemble variant=true2024.05 | 62.75 | |
| ZEROBackbone=CLIP-ViT-B-162024.05 | 59.61 | |
| PromptAlignBackbone=MaPLe2024.05 | 59.37 | |
| Open CLIP-Hzero-shot evaluation protocol=True2022.11 | 59.3 | |
| TPTBackbone=MaPLe2024.05 | 58.08 | |
| Open CLIP-gzero-shot evaluation protocol=True2022.11 | 57.2 | |
| TPTBackbone=CLIP-ViT-B-162024.05 | 54.77 | |
| Zero-ShotBackbone=MaPLe2024.05 | 50.9 | |
| EnsembleBackbone=CLIP-ViT-B-162024.05 | 49.89 | |
| Zero-ShotBackbone=CLIP-ViT-B-162024.05 | 47.87 | |
| TinyMIMModel Size=ViT-B2023.01 | 43 | |
| MAEModel Size=ViT-B2023.01 | 33.6 | |
| TinyMIMModel Size=ViT-S2023.01 | 27.5 | |
| DeiTModel Size=ViT-B2023.01 | 25.8 | |
| MAEModel Size=ViT-S2023.01 | 20.1 | |
| DeiTModel Size=ViT-S2023.01 | 18.3 | |
| TinyMIMModel Size=ViT-T2023.01 | 11 | |
| DeiTModel Size=ViT-T2023.01 | 8 | |
| MAEModel Size=ViT-T2023.01 | 7 |