Fine-grained Classification on Cars (Accuracy and Robustness)
78.4AccuracyMTA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MTABackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 78.4 | 36.6 | |
| MTABackbone=ViT-L/14, Epsilon=4/2552026.05 | 78.4 | 36.6 | |
| MTACategory=Tuning-free, Backbone=CLIP-ViT-L/14, Attack Protocol=PGD-100, eps=4.02026.06 | 78.4 | 36.6 | |
| AGCBackbone=ViT-L/14, Epsilon=4/2552026.05 | 77.3 | 95.4 | |
| R-TPTBackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 77.2 | 49.1 | |
| R-TPTBackbone=ViT-L/14, Epsilon=4/2552026.05 | 77.2 | 49.1 | |
| R-TPTCategory=Tuning-based, Backbone=CLIP-ViT-L/14, Attack Protocol=PGD-100, eps=4.02026.06 | 77.2 | 49.1 | |
| CLIPBackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 76.8 | 0 | |
| TTPBackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 76.8 | 51.1 | |
| CLIPBackbone=ViT-L/14, Epsilon=4/2552026.05 | 76.8 | 0 | |
| TTPBackbone=ViT-L/14, Epsilon=4/2552026.05 | 76.8 | 51.1 | |
| CLIPCategory=Baseline, Backbone=CLIP-ViT-L/14, Attack Protocol=PGD-100, eps=4.02026.06 | 76.8 | 0 | |
| EnsembleBackbone=ViT-L/14, Epsilon=4/2552026.05 | 76.6 | 54.4 | |
| EnsembleBackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 76.3 | 40.5 | |
| TTCCategory=Tuning-free, Backbone=CLIP-ViT-L/14, Attack Protocol=PGD-100, eps=4.02026.06 | 74.6 | 3.2 | |
| MACCategory=Tuning-free, Backbone=CLIP-ViT-L/14, Attack Protocol=PGD-100, eps=4.02026.06 | 74.6 | 69.8 | |
| TTCBackbone=CLIP-ViT-L/14, Perturbation budget (epsilon)=4.02025.12 | 67.8 | 2.2 | |
| TTCBackbone=ViT-L/14, Epsilon=4/2552026.05 | 67.8 | 2.2 | |
| MTABackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 67.7 | 18.5 | |
| AGCBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 67.3 | 93.2 | |
| R-TPTBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 67 | 34.7 | |
| EnsembleBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 66 | 41.8 | |
| CLIPBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 65.5 | 0 | |
| TTPBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 65.4 | 37.4 | |
| R-TPTBackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 58.1 | 42.9 | |
| AGCBackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 57.4 | 80.1 | |
| CLIPBackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 55.7 | 0 | |
| TTPBackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 55.6 | 41.5 | |
| TTCBackbone=ViT-B/16, Pre-train=CLIP, Epsilon (ϵ)=4/255, Attack Protocol=PGD-1002026.05 | 55 | 2.9 | |
| APT+TeCoABackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 33.9 | 33.6 | |
| TeCoABackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 22.4 | 22.3 | |
| TTCPre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Lightweight Defense, Input Modality=Vision Only2026.03 | 10.62 | 1.39 | |
| C-TPT*Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations + Prompt Tuning, Input Modality=Vision + Text2026.03 | 10.6 | 1.3 | |
| ET3Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Lightweight Defense, Input Modality=Vision Only2026.03 | 10.32 | 2.04 | |
| CLIP (Robust)Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Baseline2026.03 | 10.2 | 0.99 | |
| TPT*Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations + Prompt Tuning, Input Modality=Vision + Text2026.03 | 9.6 | 2 | |
| MTA*Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations, Input Modality=Vision Only2026.03 | 9 | 2.5 | |
| APTBackbone=ResNet50, Attack Type=PGD, Epsilon (ε)=1.02026.05 | 8.5 | 0.6 | |
| R-TPT + ET3Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations + Prompt Tuning, Input Modality=Vision + Text2026.03 | 6.21 | 3.27 | |
| Ensemble + ET3Pre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations, Input Modality=Vision Only2026.03 | 5.77 | 3.03 | |
| R-TPTPre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations + Prompt Tuning, Input Modality=Vision + Text2026.03 | 5.57 | 2.79 | |
| EnsemblePre-trained Model=TeCoA CLIP-ViT-B/32, Attack Protocol=PGD-100 (ϵ = 4/255), Defense Category=Multiple Augmentations, Input Modality=Vision Only2026.03 | 5.55 | 2.8 |