Fine-grained Image Classification on DTD (test)
15.6Top-1 ErrorFull FT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Full FTBackbone=SWIN-L, % Trainable parameters=100%, No backbone backpropagation=false2023.03 | 15.6 | — | — | |
| LoRABackbone=SWIN-L, % Trainable parameters=0.8%, No backbone backpropagation=false2023.03 | 15.8 | — | — | |
| In. MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=true2023.03 | 16.7 | — | — | |
| MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=false2023.03 | 16.7 | — | — | |
| AdaLNBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | 16.7 | — | — | |
| BitFitBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | 17 | — | — | |
| InCABackbone=ViT-L/162023.03 | 17.2 | — | — | |
| In. MLP-3Backbone=ViT-L/162023.03 | 17.4 | — | — | |
| In. LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=true2023.03 | 17.7 | — | — | |
| InCABackbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | 17.8 | — | — | |
| Full FTBackbone=ViT-L/162023.03 | 18.2 | — | — | |
| InCA (last)Backbone=ViT-L/162023.03 | 18.4 | — | — | |
| In. LPBackbone=ViT-L/162023.03 | 18.9 | — | — | |
| InCA (last)Backbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | 19.1 | — | — | |
| LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | 19.1 | — | — | |
| LoRABackbone=ViT-L/162023.03 | 19.4 | — | — | |
| MLP-3Backbone=ViT-L/162023.03 | 20.1 | — | — | |
| LPBackbone=ViT-L/162023.03 | 20.6 | — | — | |
| VPTBackbone=ViT-L/162023.03 | 21.4 | — | — | |
| BitFitBackbone=ViT-L/162023.03 | 21.9 | — | — | |
| AdaLNBackbone=ViT-L/162023.03 | 22.2 | — | — | |
| CLIPCategory=Baseline, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 42.1 | 0 | |
| CLIPBackbone=CLIP-ResNet50, Epsilon=1.02026.06 | — | 40.4 | 2.1 | |
| DOCBackbone=CLIP-ResNet50, Epsilon=1.0, Effective batch size=12026.06 | — | 38.5 | 15.5 | |
| EnsembleBackbone=CLIP-ResNet50, Epsilon=1.0, Augmentation views=152026.06 | — | 37.8 | 25.8 | |
| MACCategory=Tuning-free, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 41.7 | 32.9 | |
| MTACategory=Tuning-free, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 43.2 | 15.7 | |
| R-TPTCategory=Tuning-based, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 42.1 | 29.3 | |
| R-TPTBackbone=CLIP-ResNet50, Epsilon=1.0, Augmentation views=152026.06 | — | 39.1 | 27.1 | |
| SS-TPTBackbone=CLIP-ResNet50, Epsilon=1.0, Augmentation views=152026.06 | — | 40 | 34.6 | |
| TAPTCategory=Tuning-based, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 39.2 | 12.4 | |
| TPTBackbone=CLIP-ResNet50, Epsilon=1.0, Augmentation views=152026.06 | — | 41.3 | 4.5 | |
| TTCCategory=Tuning-free, Backbone=CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4.0)2026.06 | — | 38.9 | 6.2 | |
| TTCBackbone=CLIP-ResNet50, Epsilon=1.0, Effective batch size=12026.06 | — | 38.6 | 15.2 |