Image Classification on ImageNet Robustness Suite
93.96Top-1 Accuracy (ImageNet-A)SAM
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SAM#Epochs=100, Runtime=41h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 93.96 | — | — | — | 81.86 | 73.42 | — | — | — | — | — | 87.61 | 55.56 | 42.53 | 88.23 | 69.53 | 85.54 | — | — | — | |
| Dropout#Epochs=100, Runtime=20.6h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 93.44 | — | — | — | 88.06 | 79.3 | — | — | — | — | — | 93.47 | 65.87 | 50.37 | 91.15 | 79.62 | 87.19 | — | — | — | |
| Dropout#Epochs=200, Runtime=41.1h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 93.33 | — | — | — | 87.99 | 79.63 | — | — | — | — | — | 90.95 | 66.9 | 51.23 | 92.56 | 81.24 | 87.6 | — | — | — | |
| ASAM#Epochs=100, Runtime=41.1h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 92.99 | — | — | — | 81.47 | 72.55 | — | — | — | — | — | 85.85 | 55.13 | 40.74 | 89.03 | 67.8 | 84.31 | — | — | — | |
| DAMP#Epochs=100, Runtime=20.7h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 92.92 | — | — | — | 83.16 | 74.76 | — | — | — | — | — | 92.76 | 57.85 | 44.78 | 88.79 | 69.92 | 85.65 | — | — | — | |
| DAMP#Epochs=200, Runtime=41.1h, Backbone=ViT-S16, Data Augmentation=Basic Inception-style2024.06 | 90.56 | — | — | — | 81.82 | 72.15 | — | — | — | — | — | 84.33 | 55.58 | 41.06 | 87.87 | 68.36 | 84.18 | — | — | — | |
| TuringViT-24LResolution=dyn., Pretraining data=0.85B, Evaluation Protocol=Zero-shot2026.06 | 89.7 | 83.9 | 78 | 95.3 | 73.6 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.1 | |
| TuringViT-18LResolution=dyn., Pretraining data=0.85B, Evaluation Protocol=Zero-shot2026.06 | 87.9 | 83.1 | 77.6 | 95 | 72.8 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.7 | |
| VanillaModel=DINOv3, r=4, GFLOPs=13492026.04 | 86.53 | — | — | 92.16 | 71.5 | 83.4 | — | — | — | — | — | — | 65.36 | — | — | — | — | — | — | — | |
| EVAFine-tuning Protocol=without specialized fine-tuning2022.11 | 86.2 | 89.6 | 81.6 | 90.8 | 67.7 | 84 | — | 88.3 | 5.6 | — | — | — | — | — | — | — | — | — | — | — | |
| CATISModel=DINOv3, r=4, GFLOPs=815.82026.04 | 86.15 | — | — | 91.67 | 71.11 | 82.98 | — | — | — | — | — | — | 59.94 | — | — | — | — | — | — | — | |
| Seed1.5-ViTResolution=dyn., Pretraining data=4.8B, Evaluation Protocol=Zero-shot2026.06 | 85.5 | 83.6 | 77.6 | 95.2 | 74.1 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.2 | |
| Eff-L2-NSFine-tuning Protocol=without specialized fine-tuning2022.11 | 84.8 | 88.4 | 80.5 | 90.6 | 47.6 | 77.8 | — | 74.7 | 10.6 | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP2-LResolution=384, Pretraining data=10B, Evaluation Protocol=Zero-shot2026.06 | 84.3 | 83.1 | 77.4 | 95.7 | 75.5 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.4 | |
| ToFuModel=DINOv3, r=4, GFLOPs=815.82026.04 | 83.91 | — | — | 90.37 | 70.44 | 81.57 | — | — | — | — | — | — | 54.32 | — | — | — | — | — | — | — | |
| ToMeModel=DINOv3, r=4, GFLOPs=815.82026.04 | 83.76 | — | — | 91.41 | 70.71 | 81.96 | — | — | — | — | — | — | 59.8 | — | — | — | — | — | — | — | |
| MCTFModel=DINOv3, r=4, GFLOPs=815.82026.04 | 83.44 | — | — | 91.52 | 71.05 | 82 | — | — | — | — | — | — | 59.81 | — | — | — | — | — | — | — | |
| PiToMeModel=DINOv3, r=4, GFLOPs=814.12026.04 | 83.41 | — | — | 91.24 | 70.83 | 81.83 | — | — | — | — | — | — | 56.92 | — | — | — | — | — | — | — | |
| BEiTFine-tuning Protocol=without specialized fine-tuning2022.11 | 81.7 | 88.6 | 79.9 | 90.7 | 56.8 | 78.5 | — | 73.2 | 10.1 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT3Fine-tuning Protocol=without specialized fine-tuning2022.11 | 79.2 | 87.7 | 79.1 | 90.2 | 54.9 | 77 | — | 70.6 | 10.7 | — | — | — | — | — | — | — | — | — | — | — | |
| MAEFine-tuning Protocol=without specialized fine-tuning2022.11 | 76.7 | 87.8 | 79.2 | 90.3 | 50.9 | 75.2 | — | 66.5 | 12.6 | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTv2Fine-tuning Protocol=without specialized fine-tuning2022.11 | 76.2 | 88.4 | 80.1 | 90.3 | 58.3 | 78.3 | — | 76.4 | 10.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin V2Fine-tuning Protocol=without specialized fine-tuning2022.11 | 73.9 | 87.5 | 77.3 | 90.2 | 52.3 | 74.8 | — | 67.7 | 12.7 | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNextFine-tuning Protocol=without specialized fine-tuning2022.11 | 70.8 | 87.5 | 77.7 | 90.5 | 53.7 | 74.5 | — | 67 | 13 | — | — | — | — | — | — | — | — | — | — | — | |
| MobileCLIP2-LResolution=224, Pretraining data=1.9B, Evaluation Protocol=Zero-shot2026.06 | 69 | 81.9 | 74.7 | 91.7 | 69.8 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | 75.3 | |
| TDABackbone=ViT-L/142024.10 | 61.27 | 76.28 | 68.42 | 88.41 | — | 71.81 | 70.69 | — | — | — | 64.67 | — | — | — | — | — | — | — | — | — | |
| DPEBackbone=ViT-L/142024.10 | 61.09 | 77.87 | 70.83 | 89.18 | — | 73.06 | 71.86 | — | — | — | 66.33 | — | — | — | — | — | — | — | — | — | |
| TPTBackbone=ViT-B/162022.09 | 54.47 | 68.96 | 63.46 | 77.1 | 47.93 | 62.38 | 60.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenCLIPBackbone=ViT-L/142024.10 | 53.88 | 74.04 | 67.69 | 87.42 | — | 69.31 | 68.13 | — | — | — | 63.18 | — | — | — | — | — | — | — | — | — | |
| CoCoOpBackbone=ViT-B/162022.09 | 50.76 | 70.7 | 63.93 | 76.09 | 48.6 | 62.02 | 59.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoOpBackbone=ViT-B/162022.09 | 49.99 | 71.71 | 64.49 | 75.51 | 48.1 | 61.96 | 59.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-B/162022.09 | 47.87 | 66.73 | 60.86 | 73.98 | 46.09 | 59.11 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaModel=DeiT-3-L, r=11, GFLOPs=61.62026.04 | 45.13 | — | — | 57.39 | 44.19 | 48.9 | — | — | — | — | — | — | 41.55 | — | — | — | — | — | — | — | |
| CATISModel=ViT-L, r=11, GFLOPs=22.82026.04 | 43.65 | — | — | 59.76 | 45.12 | 49.51 | — | — | — | — | — | — | 33.77 | — | — | — | — | — | — | — | |
| VanillaModel=ViT-L, r=11, GFLOPs=61.62026.04 | 43.27 | — | — | 60.89 | 45.55 | 49.9 | — | — | — | — | — | — | 41.91 | — | — | — | — | — | — | — | |
| Dropout#Epochs=500, Runtime=111h, Backbone=ViT-S16, Data Augmentation=MixUp and RandAugment2024.06 | 40.85 | — | — | — | 71.03 | 62.38 | — | — | — | — | — | 62.45 | 84.29 | 34.35 | 86.59 | 56.31 | 80.87 | — | — | — | |
| SAM#Epochs=300, Runtime=123h, Backbone=ViT-S16, Data Augmentation=MixUp and RandAugment2024.06 | 40.05 | — | — | — | 70.85 | 61.66 | — | — | — | — | — | 59.92 | 83.91 | 34.34 | 85.99 | 55.63 | 80.18 | — | — | — | |
| ASAM#Epochs=300, Runtime=123h, Backbone=ViT-S16, Data Augmentation=MixUp and RandAugment2024.06 | 39.44 | — | — | — | 69.13 | 61.02 | — | — | — | — | — | 59.38 | 83.64 | 33.82 | 85.41 | 54.43 | 80.5 | — | — | — | |
| DAMP#Epochs=500, Runtime=111h, Backbone=ViT-S16, Data Augmentation=MixUp and RandAugment2024.06 | 39.3 | — | — | — | 68.03 | 60.72 | — | — | — | — | — | 59.87 | 83.12 | 34.01 | 84.74 | 54.16 | 80.05 | — | — | — | |
| Dropout#Epochs=275, Runtime=123h, Backbone=ViT-B16, Data Augmentation=MixUp and RandAugment2024.06 | 39.14 | — | — | — | 71.36 | 61.08 | — | — | — | — | — | 56.43 | 82.85 | 33.13 | 87.72 | 56.15 | 79.13 | — | — | — | |
| SAM#Epochs=150, Runtime=135h, Backbone=ViT-B16, Data Augmentation=MixUp and RandAugment2024.06 | 39.09 | — | — | — | 71.22 | 61.61 | — | — | — | — | — | 61.85 | 82.69 | 32.95 | 88.38 | 55.33 | 79.48 | — | — | — | |
| DAMP#Epochs=275, Runtime=124h, Backbone=ViT-B16, Data Augmentation=MixUp and RandAugment2024.06 | 37.77 | — | — | — | 67.91 | 59.19 | — | — | — | — | — | 55.2 | 80.49 | 31.63 | 87.06 | 52.32 | 78.69 | — | — | — | |
| ASAM#Epochs=150, Runtime=136h, Backbone=ViT-B16, Data Augmentation=MixUp and RandAugment2024.06 | 37.41 | — | — | — | 69.54 | 59.85 | — | — | — | — | — | 58.87 | 82.21 | 30.76 | 88.03 | 51.84 | 78.83 | — | — | — | |
| TPGM-CBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Controlled Projected Gradient Method, Number of Classes=Full ImageNet2023.03 | 36.79 | 82.41 | 73.91 | 62.48 | 54.91 | 78.16 | 51.39 | — | -1.86 | 26.51 | — | — | — | — | — | — | — | — | — | — | |
| VanillaModel=DeiT-3-B, r=23, GFLOPs=17.62026.04 | 36.75 | — | — | 36.8 | 54.07 | 42.54 | — | — | — | — | — | — | 41.05 | — | — | — | — | — | — | — | |
| WISEBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Weight Ensemble, Number of Classes=Full ImageNet2023.03 | 36.11 | 82.11 | 73.61 | 61.77 | 54.16 | 77.86 | 50.68 | — | -2.23 | 24.75 | — | — | — | — | — | — | — | — | — | — | |
| TPGMBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Trainable Projected Gradient Method, Number of Classes=Full ImageNet2023.03 | 34.29 | 84.19 | 75.41 | 57.19 | 54.38 | 79.8 | 48.62 | — | 0.2 | 19.69 | — | — | — | — | — | — | — | — | — | — | |
| Zero-ShotBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Zero-Shot, Number of Classes=Full ImageNet2023.03 | 30.6 | 67.68 | 61.41 | 56.77 | 45.53 | 64.54 | 44.3 | — | -18.91 | 8.64 | — | — | — | — | — | — | — | — | — | — | |
| BitFitBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Parameter-Efficient Fine-tuning, Number of Classes=Full ImageNet2023.03 | 27.19 | 78.02 | 67.69 | 50.66 | 46.5 | 72.85 | 41.45 | — | -8.42 | 2.45 | — | — | — | — | — | — | — | — | — | — | |
| LPBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Linear Probing, Number of Classes=Full ImageNet2023.03 | 27.13 | 77.99 | 67.74 | 50.71 | 46.47 | 72.86 | 41.44 | — | -8.51 | 2 | — | — | — | — | — | — | — | — | — | — | |
| TPTBackbone=RN502022.09 | 26.6 | 60.77 | 54.7 | 59.08 | 35.17 | 47.27 | 43.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vanilla FTBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Fine-tuning, Number of Classes=Full ImageNet2023.03 | 26.52 | 84.2 | 75.08 | 46.45 | 48.9 | 79.64 | 40.63 | — | 0 | 0 | — | — | — | — | — | — | — | — | — | — | |
| L2-SPBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Fine-tuning, Number of Classes=Full ImageNet2023.03 | 26.19 | 84.1 | 75.05 | 46.58 | 48.51 | 79.58 | 40.43 | — | -0.08 | -0.49 | — | — | — | — | — | — | — | — | — | — | |
| CATISModel=DeiT-3-L, r=11, GFLOPs=22.82026.04 | 26.11 | — | — | 42.64 | 35.12 | 34.62 | — | — | — | — | — | — | 29.36 | — | — | — | — | — | — | — | |
| LP-FTBackbone=ViT-B, Pre-trained=CLIP, Evaluation Protocol=Linear Probing then Fine-tuning, Number of Classes=Full ImageNet2023.03 | 25.62 | 83.5 | 73.95 | 46.21 | 48.83 | 78.73 | 40.22 | — | -1.15 | -1 | — | — | — | — | — | — | — | — | — | — | |
| CATISModel=DeiT-3-B, r=23, GFLOPs=6.32026.04 | 25.44 | — | — | 43.96 | 33.44 | 34.28 | — | — | — | — | — | — | 26.21 | — | — | — | — | — | — | — | |
| PiToMeModel=DeiT-3-L, r=11, GFLOPs=22.82026.04 | 23.64 | — | — | 35.03 | 25.96 | 28.21 | — | — | — | — | — | — | 16.38 | — | — | — | — | — | — | — | |
| CoCoOpBackbone=RN502022.09 | 23.38 | 62.86 | 55.59 | 57.55 | 34.74 | 46.82 | 42.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaModel=DeiT-3-S, r=23, GFLOPs=4.62026.04 | 23.27 | — | — | 46.54 | 35.42 | 35.08 | — | — | — | — | — | — | 29.06 | — | — | — | — | — | — | — | |
| CoOpBackbone=RN502022.09 | 23.23 | 63.27 | 55.5 | 57.08 | 34.68 | 46.75 | 42.62 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=RN502022.09 | 21.83 | 58.16 | 51.41 | 56.15 | 33.37 | 44.18 | 40.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PiToMeModel=ViT-L, r=11, GFLOPs=22.82026.04 | 21.72 | — | — | 39.26 | 29.92 | 30.3 | — | — | — | — | — | — | 18.1 | — | — | — | — | — | — | — | |
| VanillaModel=ViT-B, r=13, GFLOPs=17.62026.04 | 21.21 | — | — | 41.24 | 16.59 | 26.35 | — | — | — | — | — | — | 25.03 | — | — | — | — | — | — | — | |
| CATISModel=ViT-B, r=13, GFLOPs=10.42026.04 | 20.93 | — | — | 41.04 | 16.89 | 26.29 | — | — | — | — | — | — | 23.51 | — | — | — | — | — | — | — | |
| ToFuModel=ViT-B, r=13, GFLOPs=10.42026.04 | 20.76 | — | — | 39.01 | 16.41 | 25.39 | — | — | — | — | — | — | 21.73 | — | — | — | — | — | — | — | |
| ToMeModel=ViT-B, r=13, GFLOPs=10.42026.04 | 19.55 | — | — | 40.95 | 16.85 | 25.78 | — | — | — | — | — | — | 23.13 | — | — | — | — | — | — | — | |
| MCTFModel=ViT-B, r=13, GFLOPs=10.42026.04 | 18.97 | — | — | 40.5 | 16.17 | 25.21 | — | — | — | — | — | — | 21.84 | — | — | — | — | — | — | — | |
| PiToMeModel=ViT-B, r=13, GFLOPs=10.42026.04 | 18.92 | — | — | 38.55 | 16.6 | 24.69 | — | — | — | — | — | — | 20.17 | — | — | — | — | — | — | — | |
| PiToMeModel=DeiT-3-B, r=23, GFLOPs=6.32026.04 | 17.53 | — | — | 29.13 | 20.74 | 22.47 | — | — | — | — | — | — | 13.92 | — | — | — | — | — | — | — | |
| VanillaModel=ViT-S, r=13, GFLOPs=4.62026.04 | 14.35 | — | — | 35.07 | 14.71 | 21.38 | — | — | — | — | — | — | 20.27 | — | — | — | — | — | — | — | |
| CATISModel=ViT-S, r=13, GFLOPs=2.72026.04 | 13.93 | — | — | 34.27 | 14.74 | 20.98 | — | — | — | — | — | — | 18.9 | — | — | — | — | — | — | — | |
| ToFuModel=ViT-S, r=13, GFLOPs=2.72026.04 | 13.48 | — | — | 31.68 | 13.97 | 19.71 | — | — | — | — | — | — | 16.84 | — | — | — | — | — | — | — | |
| ToMeModel=ViT-S, r=13, GFLOPs=2.72026.04 | 12.97 | — | — | 34.33 | 14.67 | 20.66 | — | — | — | — | — | — | 18.89 | — | — | — | — | — | — | — | |
| MCTFModel=ViT-S, r=13, GFLOPs=2.72026.04 | 12.44 | — | — | 33.42 | 13.46 | 19.77 | — | — | — | — | — | — | 17.78 | — | — | — | — | — | — | — | |
| PiToMeModel=ViT-S, r=13, GFLOPs=2.72026.04 | 12.28 | — | — | 30.84 | 14.13 | 19.08 | — | — | — | — | — | — | 15.4 | — | — | — | — | — | — | — | |
| MCTFModel=DeiT-3-L, r=11, GFLOPs=22.82026.04 | 10.69 | — | — | 33.13 | 28.87 | 24.23 | — | — | — | — | — | — | 20.3 | — | — | — | — | — | — | — | |
| CATISModel=DeiT-3-S, r=23, GFLOPs=1.72026.04 | 10.04 | — | — | 25.26 | 20.12 | 18.47 | — | — | — | — | — | — | 12.38 | — | — | — | — | — | — | — | |
| ToMeModel=DeiT-3-L, r=11, GFLOPs=22.82026.04 | 9.93 | — | — | 31.33 | 27.87 | 23.04 | — | — | — | — | — | — | 19.51 | — | — | — | — | — | — | — | |
| MCTFModel=DeiT-3-B, r=23, GFLOPs=6.32026.04 | 9.89 | — | — | 31.41 | 25.62 | 22.31 | — | — | — | — | — | — | 17.75 | — | — | — | — | — | — | — | |
| ToMeModel=DeiT-3-B, r=23, GFLOPs=6.32026.04 | 8.89 | — | — | 30.57 | 24.93 | 21.46 | — | — | — | — | — | — | 17.43 | — | — | — | — | — | — | — | |
| PiToMeModel=DeiT-3-S, r=23, GFLOPs=1.72026.04 | 8.52 | — | — | 18.22 | 12.6 | 13.11 | — | — | — | — | — | — | 6.34 | — | — | — | — | — | — | — | |
| ToFuModel=DeiT-3-B, r=23, GFLOPs=6.32026.04 | 7.65 | — | — | 22.15 | 17.01 | 15.6 | — | — | — | — | — | — | 11.57 | — | — | — | — | — | — | — | |
| ToFuModel=DeiT-3-L, r=11, GFLOPs=22.82026.04 | 7.07 | — | — | 12.39 | 11.63 | 10.36 | — | — | — | — | — | — | 8.24 | — | — | — | — | — | — | — | |
| ToMeModel=ViT-L, r=11, GFLOPs=22.82026.04 | 6.57 | — | — | 24.86 | 19.25 | 16.89 | — | — | — | — | — | — | 15.19 | — | — | — | — | — | — | — | |
| MCTFModel=ViT-L, r=11, GFLOPs=22.82026.04 | 6 | — | — | 25.26 | 20.15 | 17.14 | — | — | — | — | — | — | 14.54 | — | — | — | — | — | — | — | |
| MCTFModel=DeiT-3-S, r=23, GFLOPs=1.72026.04 | 4.8 | — | — | 16.49 | 13.72 | 11.67 | — | — | — | — | — | — | 8.94 | — | — | — | — | — | — | — | |
| ToMeModel=DeiT-3-S, r=23, GFLOPs=1.72026.04 | 4.07 | — | — | 16.99 | 14.6 | 11.89 | — | — | — | — | — | — | 8.26 | — | — | — | — | — | — | — | |
| ToFuModel=DeiT-3-S, r=23, GFLOPs=1.72026.04 | 3.49 | — | — | 11.11 | 7.92 | 7.51 | — | — | — | — | — | — | 4.63 | — | — | — | — | — | — | — | |
| ToFuModel=ViT-L, r=11, GFLOPs=22.82026.04 | 3 | — | — | 10.95 | 7.44 | 7.13 | — | — | — | — | — | — | 2.66 | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K2026.03 | — | 63.35 | — | — | — | — | 57.44 | — | — | — | — | — | — | — | — | — | — | 8.82 | 20.46 | — | |
| CLIPBackbone=ViT-B/162026.03 | — | — | — | — | — | — | 63.76 | — | — | — | — | — | — | — | — | — | — | 13.15 | — | — | |
| FAREBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K, Adversarial Defense Type=Adversarial Fine-tuning2026.03 | — | 47.38 | — | — | — | — | 41.56 | — | — | — | — | — | — | — | — | — | — | 13.43 | 25.07 | — | |
| FAREBackbone=ViT-B/162026.03 | — | — | — | — | — | — | 53.92 | — | — | — | — | — | — | — | — | — | — | 17.54 | — | — | |
| FLYPBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K, Adversarial Defense Type=Robust Fine-tuning2026.03 | — | 72.15 | — | — | — | — | 55.32 | — | — | — | — | — | — | — | — | — | — | 8.49 | 20.03 | — | |
| FLYPBackbone=ViT-B/162026.03 | — | — | — | — | — | — | 67.29 | — | — | — | — | — | — | — | — | — | — | 12.71 | — | — | |
| GRACEBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K2026.03 | — | 74.21 | — | — | — | — | 57.01 | — | — | — | — | — | — | — | — | — | — | 22.44 | 39.69 | — | |
| GRACEBackbone=ViT-B/162026.03 | — | — | — | — | — | — | 67.29 | — | — | — | — | — | — | — | — | — | — | 33.44 | — | — | |
| LAATBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K, Adversarial Defense Type=Adversarial Fine-tuning2026.03 | — | 55.46 | — | — | — | — | 41.95 | — | — | — | — | — | — | — | — | — | — | 17.9 | 30.69 | — | |
| LAATBackbone=ViT-B/162026.03 | — | — | — | — | — | — | 50.31 | — | — | — | — | — | — | — | — | — | — | 26.25 | — | — | |
| PMG-AFTBackbone=ViT-B/32, Fine-tuning Dataset=ImageNet-1K, Adversarial Defense Type=Adversarial Fine-tuning2026.03 | — | 58.2 | — | — | — | — | 43.4 | — | — | — | — | — | — | — | — | — | — | 19.57 | 32.85 | — |