Image Classification on ImageNet (INet)
86.95AccuracyCaRot
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CaRotBackbone=CLIP ViT-L/142026.05 | 86.95 | 0.0349 | |
| TRACERBackbone=CLIP ViT-L/142026.05 | 86.27 | 0.0507 | |
| FLYPBackbone=CLIP ViT-L/142026.05 | 86.19 | 0.0729 | |
| Attn. bias baselineBackbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 85.4 | — | |
| DINOv2 baseline (∅)Backbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 85.3 | — | |
| Ours (Specialization)Backbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 85.3 | — | |
| LP-FTBackbone=CLIP ViT-L/14, Protocol=Linear Probing then Fine-Tuning2026.05 | 85.26 | 0.0993 | |
| Attn. bias + CaiTBackbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 85.2 | — | |
| Attn. bias + Ours (Specialization)Backbone=ViT-L, Framework=DINOv2, Attention Bias=true2026.02 | 85.2 | — | |
| FTBackbone=CLIP ViT-L/14, Protocol=Fine-Tuning2026.05 | 84.74 | 0.1056 | |
| CaiTBackbone=ViT-L, Framework=DINOv2, Attention Bias=false2026.02 | 84 | — | |
| TRACERBackbone=CLIP ResNet502026.05 | 76.48 | 0.047 | |
| LP-FTBackbone=CLIP ResNet502026.05 | 76.25 | 0.1042 | |
| FTBackbone=CLIP ResNet502026.05 | 76.21 | 0.0983 | |
| FLYPBackbone=CLIP ResNet502026.05 | 76.16 | 0.0516 | |
| CaRotBackbone=CLIP ResNet502026.05 | 76.12 | 0.0471 | |
| ZSBackbone=CLIP ViT-L/14, Protocol=Zero-Shot2026.05 | 75.55 | 0.059 | |
| Ta-AdapterShots=16, Venue=PR’242025.12 | 74.7 | — | |
| ProposedShots=16, Venue=-2025.12 | 71.2 | — | |
| TPTBackbone=CLIP-ViTB/162025.03 | 69 | 10.6 | |
| C-TPTBackbone=CLIP-ViTB/162025.03 | 68.5 | 3.15 | |
| ProposedShots=8, Venue=-2025.12 | 68.2 | — | |
| ProposedShots=1, Venue=-2025.12 | 68.1 | — | |
| Robust-adapt-SaLs-CTPTBackbone=CLIP-ViTB/162025.03 | 68.04 | 2.63 | |
| Robust-adapt-Penalty-CTPTBackbone=CLIP-ViTB/162025.03 | 68.04 | 2.63 | |
| Robust-adapt-ZS-CTPTBackbone=CLIP-ViTB/162025.03 | 68.01 | 3.01 | |
| ProposedShots=4, Venue=-2025.12 | 68 | — | |
| ProposedShots=2, Venue=-2025.12 | 67.9 | — | |
| O-TPTBackbone=CLIP-ViTB/162025.03 | 67.33 | 1.96 | |
| Zero ShotBackbone=CLIP-ViTB/162025.03 | 66.7 | 2.12 | |
| CAAShots=16, Venue=ICCV’252025.12 | 66 | — | |
| GraphAdapterShots=16, Venue=NeurIPS’232025.12 | 65.7 | — | |
| TIP-Adapter-FShots=16, Venue=ECCV’222025.12 | 65.5 | — | |
| CLAPShots=16, Venue=CVPR’242025.12 | 65 | — | |
| CAAShots=8, Venue=ICCV’252025.12 | 64.9 | — | |
| TaskResShots=8, Venue=CVPR’232025.12 | 64.7 | — | |
| GraphAdapterShots=8, Venue=NeurIPS’232025.12 | 64.2 | — | |
| TIP-Adapter-FShots=8, Venue=ECCV’222025.12 | 64 | — | |
| TaskResShots=16, Venue=CVPR’232025.12 | 63.7 | — | |
| TaskResShots=4, Venue=CVPR’232025.12 | 63.6 | — | |
| CLIP-AdapterShots=16, Venue=IJCV’242025.12 | 63.6 | — | |
| CAAShots=4, Venue=ICCV’252025.12 | 63.3 | — | |
| GraphAdapterShots=4, Venue=NeurIPS’232025.12 | 63.1 | — | |
| CLAPShots=8, Venue=CVPR’242025.12 | 62.9 | — | |
| CLIP-AdapterShots=4, Venue=IJCV’242025.12 | 62.7 | — | |
| CLIP-AdapterShots=8, Venue=IJCV’242025.12 | 62.7 | — | |
| TIP-Adapter-FShots=4, Venue=ECCV’222025.12 | 62.5 | — | |
| GraphAdapterShots=2, Venue=NeurIPS’232025.12 | 62.3 | — | |
| CAAShots=2, Venue=ICCV’252025.12 | 62.1 | — | |
| TaskResShots=1, Venue=CVPR’232025.12 | 61.9 | — | |
| TaskResShots=2, Venue=CVPR’232025.12 | 61.9 | — | |
| TIP-Adapter-FShots=2, Venue=ECCV’222025.12 | 61.7 | — | |
| GraphAdapterShots=1, Venue=NeurIPS’232025.12 | 61.5 | — | |
| CAAShots=1, Venue=ICCV’252025.12 | 61.5 | — | |
| CLIP-AdapterShots=2, Venue=IJCV’242025.12 | 61.5 | — | |
| CLIP-AdapterShots=1, Venue=IJCV’242025.12 | 61.2 | — | |
| TIP-Adapter-FShots=1, Venue=ECCV’222025.12 | 61.1 | — | |
| CLAPShots=4, Venue=CVPR’242025.12 | 60.7 | — | |
| CLIPShots=0, Venue=ICML’222025.12 | 60.3 | — | |
| ZSBackbone=CLIP ResNet502026.05 | 59.83 | 0.0624 | |
| CLAPShots=1, Venue=CVPR’242025.12 | 58.5 | — | |
| CLAPShots=2, Venue=CVPR’242025.12 | 58.5 | — |