Image Classification on ImageNet-V2 reproduction (val)
70.37Top-1 AccZERO
Evaluation Results
| Method | Links | |
|---|---|---|
| ZEROBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 70.37 | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=prompt tuning (Theta_etx), Adaptation steps (t)=12024.05 | 69.77 | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=full image encoder tuning (Theta_i), Adaptation steps (t)=32024.05 | 69.77 | |
| Zero-ShotBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 67.8 | |
| ZEROBackbone=MaPLe2024.05 | 66.81 | |
| PromptAlignBackbone=MaPLe2024.05 | 65.29 | |
| ZEROBackbone=CLIP-ViT-B-16, Ensemble variant=true2024.05 | 65.23 | |
| TPTBackbone=MaPLe2024.05 | 64.87 | |
| ZEROBackbone=CLIP-ViT-B-162024.05 | 64.16 | |
| Zero-ShotBackbone=MaPLe2024.05 | 64.07 | |
| TPTBackbone=CLIP-ViT-B-162024.05 | 63.45 | |
| EnsembleBackbone=CLIP-ViT-B-162024.05 | 61.88 | |
| Zero-ShotBackbone=CLIP-ViT-B-162024.05 | 60.86 |