Image Classification on ImageNet-A (test)
83.7Top-1 AccNoisy Student Training
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Noisy Student Trainingbackbone=EfficientNet-L22019.11 | 83.7 | 95.2 | — | — | — | — | — | — | — | — | — | — | |
| PaLI-XResolution=756, Evaluation Protocol=fine-tuned2023.05 | 72.57 | — | — | — | — | — | — | — | — | — | — | — | |
| FGABackbone=CLIP-ViT-B/162025.01 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SCAPCombine P^l_{ik}=Concat, Combine P^l, P^{l*}=Concat2025.03 | 64.52 | — | — | — | — | — | — | — | — | — | — | — | |
| SCAPCombine P^l_{ik}=Mean, Combine P^l, P^{l*}=Concat2025.03 | 64.35 | — | — | — | — | — | — | — | — | — | — | — | |
| STSS+CoOpBackbone=CLIP-ViT-B/162025.01 | 64 | — | — | — | — | — | — | — | — | — | — | — | |
| ZERO+CoOpBackbone=CLIP-ViT-B/162025.01 | 63.17 | — | — | — | — | — | — | — | — | — | — | — | |
| SCAPCombine P^l_{ik}=Concat, Combine P^l, P^{l*}=Mean2025.03 | 62.11 | — | — | — | — | — | — | — | — | — | — | — | |
| SCAPCombine P^l_{ik}=Mean, Combine P^l, P^{l*}=Mean2025.03 | 61.82 | — | — | — | — | — | — | — | — | — | — | — | |
| ZEROBackbone=CLIP-ViT-B/162025.01 | 61.35 | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 WSL2019.11 | 61 | — | — | — | — | — | — | — | — | — | — | — | |
| TDABackbone=CLIP-ViT-B/162025.01 | 60.11 | — | — | — | — | — | — | — | — | — | — | — | |
| DPEBackbone=CLIP-ViT-B/162025.01 | 59.63 | — | — | — | — | — | — | — | — | — | — | — | |
| PromptAlign⋆Backbone=CLIP-ViT-B/162025.01 | 59.37 | — | — | — | — | — | — | — | — | — | — | — | |
| MTA+CoOpBackbone=CLIP-ViT-B/162025.01 | 59.29 | — | — | — | — | — | — | — | — | — | — | — | |
| DiffTPT+CoOpBackbone=CLIP-ViT-B/162025.01 | 58.09 | — | — | — | — | — | — | — | — | — | — | — | |
| MTABackbone=CLIP-ViT-B/162025.01 | 57.41 | — | — | — | — | — | — | — | — | — | — | — | |
| TPT+CoOpBackbone=CLIP-ViT-B/162025.01 | 56.88 | — | — | — | — | — | — | — | — | — | — | — | |
| PaLI-XResolution=224, Evaluation Protocol=fine-tuned2023.05 | 55.97 | — | — | — | — | — | — | — | — | — | — | — | |
| DiffTPTBackbone=CLIP-ViT-B/162025.01 | 55.68 | — | — | — | — | — | — | — | — | — | — | — | |
| SAR†+CoOpBackbone=CLIP-ViT-B/16, Evaluation Protocol=single-sample setting2025.01 | 55.35 | — | — | — | — | — | — | — | — | — | — | — | |
| TPTBackbone=CLIP-ViT-B/162025.01 | 53.67 | — | — | — | — | — | — | — | — | — | — | — | |
| C-TPTBackbone=CLIP-ViT-B/162025.01 | 52.9 | — | — | — | — | — | — | — | — | — | — | — | |
| C-TPT+CoOpBackbone=CLIP-ViT-B/162025.01 | 52.73 | — | — | — | — | — | — | — | — | — | — | — | |
| Tip-AdapterBackbone=CLIP-ViT-B/162025.01 | 51.04 | — | — | — | — | — | — | — | — | — | — | — | |
| SAPT+CoOpBackbone=CLIP-ViT-B/162025.01 | 51.04 | — | — | — | — | — | — | — | — | — | — | — | |
| CoCoOpBackbone=CLIP-ViT-B/162025.01 | 50.63 | — | — | — | — | — | — | — | — | — | — | — | |
| PaLI-17BResolution=224, Evaluation Protocol=fine-tuned2023.05 | 50 | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-ViT-B/16Backbone=CLIP-ViT-B/162025.01 | 49.89 | — | — | — | — | — | — | — | — | — | — | — | |
| CoOpBackbone=CLIP-ViT-B/162025.01 | 49.71 | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-L22019.11 | 49.6 | 78.6 | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 (32 x 8d) + WSL PretrainingBackbone=ResNeXt-101 (32 x 8d), Pre-training=WSL (1000x data)2020.06 | 45.4 | — | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=AR-L, Annotated segmentation=false2022.06 | 42.4 | 68 | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=AR-L, Annotated segmentation=true2022.06 | 42.1 | 67.5 | — | — | — | — | — | — | — | — | — | — | |
| ALIGN (Baseline)Evaluation Protocol=zero-shot2022.05 | 39.97 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=384, Evaluation Protocol=zero-shot2022.05 | 37.95 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=768, Evaluation Protocol=zero-shot2022.05 | 37.84 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=192, Evaluation Protocol=zero-shot2022.05 | 36.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BGroup=Transformers, FLOPs (G)=15.4, Params (M)=87.82021.05 | 35.8 | — | — | — | — | — | — | — | — | — | — | — | |
| DINOBackbone=ViT-B, Modality=RGB-only, Training=Fine-tuned2022.04 | 35.5 | — | — | — | — | — | — | — | — | — | — | — | |
| MAEBackbone=ViT-B, Modality=RGB-only, Training=Fine-tuned2022.04 | 35.1 | — | — | — | — | — | — | — | — | — | — | — | |
| OriginalBackbone=AR-L, Annotated segmentation=false2022.06 | 34.7 | 61 | — | — | — | — | — | — | — | — | — | — | |
| FastViT-MA36Number of Parameters=42.7M, FLOPs=7.9G2023.03 | 34.6 | — | — | — | — | — | — | — | — | — | — | — | |
| MultiMAEBackbone=ViT-B, Modality=RGB-only, Training=Fine-tuned2022.04 | 33.9 | — | — | — | — | — | — | — | — | — | — | — | |
| PiT-BGroup=Transformers, FLOPs (G)=12.5, Params (M)=73.82021.05 | 33.9 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=96, Evaluation Protocol=zero-shot2022.05 | 33.21 | — | — | — | — | — | — | — | — | — | — | — | |
| MoCo-v3Backbone=ViT-B, Modality=RGB-only, Training=Fine-tuned2022.04 | 33.2 | — | — | — | — | — | — | — | — | — | — | — | |
| FastViT-SA36Number of Parameters=30.4M, FLOPs=5.6G2023.03 | 32.3 | — | — | — | — | — | — | — | — | — | — | — | |
| LaFTerBackbone=ViT-B/322023.05 | 31.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=AR-B, Annotated segmentation=true2022.06 | 31.3 | 57.1 | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=AR-B, Annotated segmentation=false2022.06 | 31.2 | 57.2 | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-SNumber of Parameters=50.0M, FLOPs=8.7G2023.03 | 31.2 | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-RefineZero-shot=true2025.04 | 30.68 | — | — | — | — | — | — | — | — | — | — | — | |
| Diffusion ClassifierResolution=512x5122023.03 | 30.2 | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-B/322023.05 | 29.6 | — | — | — | — | — | — | — | — | — | — | — | |
| ConViT-BGroup=Transformers, FLOPs (G)=17.7, Params (M)=86.52021.05 | 29 | — | — | — | — | — | — | — | — | — | — | — | |
| T2T-ViT t-24Group=Transformers, FLOPs (G)=15.0, Params (M)=64.12021.05 | 28.9 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=48, Evaluation Protocol=zero-shot2022.05 | 28.88 | — | — | — | — | — | — | — | — | — | — | — | |
| Pre-trainedZero-shot=true2025.04 | 28.84 | — | — | — | — | — | — | — | — | — | — | — | |
| Self-KDZero-shot=true2025.04 | 28.65 | — | — | — | — | — | — | — | — | — | — | — | |
| RVT-B*Group=Transformers, FLOPs (G)=17.7, Params (M)=91.82021.05 | 28.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RVT-BGroup=Transformers, FLOPs (G)=17.7, Params (M)=86.22021.05 | 27.7 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BGroup=Transformers, FLOPs (G)=17.6, Params (M)=86.62021.05 | 27.4 | — | — | — | — | — | — | — | — | — | — | — | |
| UPLBackbone=ViT-B/322023.05 | 26.9 | — | — | — | — | — | — | — | — | — | — | — | |
| Right for the Right Reason (RRR)Backbone=AR-B, Annotated segmentation=true2022.06 | 26.8 | 53 | — | — | — | — | — | — | — | — | — | — | |
| PVT-LargeGroup=Transformers, FLOPs (G)=9.8, Params (M)=61.42021.05 | 26.6 | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B4Number of Parameters=19.3M, FLOPs=4.2G2023.03 | 26.3 | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B4Group=CNNs, FLOPs (G)=4.4, Params (M)=19.32021.05 | 26.3 | — | — | — | — | — | — | — | — | — | — | — | |
| FastViT-SA24Number of Parameters=20.6M, FLOPs=3.8G2023.03 | 26 | — | — | — | — | — | — | — | — | — | — | — | |
| RVT-S*Group=Transformers, FLOPs (G)=4.7, Params (M)=23.32021.05 | 25.7 | — | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=ViT-L, Annotated segmentation=true2022.06 | 25.2 | 49.6 | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=ViT-L, Annotated segmentation=false2022.06 | 25.2 | 50 | — | — | — | — | — | — | — | — | — | — | |
| GradMaskBackbone=AR-B, Annotated segmentation=true2022.06 | 25.1 | 51.4 | — | — | — | — | — | — | — | — | — | — | |
| TNT-SGroup=Transformers, FLOPs (G)=5.2, Params (M)=23.82021.05 | 24.7 | — | — | — | — | — | — | — | — | — | — | — | |
| ConViT-SNumber of Parameters=27.8M, FLOPs=5.4G2023.03 | 24.5 | — | — | — | — | — | — | — | — | — | — | — | |
| ConViT-SGroup=Transformers, FLOPs (G)=5.4, Params (M)=27.82021.05 | 24.5 | — | — | — | — | — | — | — | — | — | — | — | |
| SupervisedBackbone=ViT-B, Modality=RGB-only, Training=Fine-tuned2022.04 | 24.2 | — | — | — | — | — | — | — | — | — | — | — | |
| ConvNeXt-TNumber of Parameters=28.6M, FLOPs=4.5G2023.03 | 24.2 | — | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=ViT-B, Annotated segmentation=true2022.06 | 24.1 | 48 | — | — | — | — | — | — | — | — | — | — | |
| RVT-SNumber of Parameters=22.1M, FLOPs=4.7G2023.03 | 24.1 | — | — | — | — | — | — | — | — | — | — | — | |
| RVT-SGroup=Transformers, FLOPs (G)=4.7, Params (M)=22.12021.05 | 24.1 | — | — | — | — | — | — | — | — | — | — | — | |
| OriginalBackbone=AR-B, Annotated segmentation=false2022.06 | 23.9 | 49.2 | — | — | — | — | — | — | — | — | — | — | |
| T2T-ViT t-14Group=Transformers, FLOPs (G)=6.1, Params (M)=21.52021.05 | 23.9 | — | — | — | — | — | — | — | — | — | — | — | |
| RobustViTBackbone=ViT-B, Annotated segmentation=false2022.06 | 23 | 45.7 | — | — | — | — | — | — | — | — | — | — | |
| ContrastiveZero-shot=true2025.04 | 22.92 | — | — | — | — | — | — | — | — | — | — | — | |
| ALIGN-MRLRep. Size=24, Evaluation Protocol=zero-shot2022.05 | 22.75 | — | — | — | — | — | — | — | — | — | — | — | |
| m2-mixZero-shot=true2025.04 | 22.51 | — | — | — | — | — | — | — | — | — | — | — | |
| Res2Net-152 v1bBackbone=Res2Net-152 v1b, Model Size=Larger Models2020.06 | 22.4 | — | — | — | — | — | — | — | — | — | — | — | |
| PiT-SGroup=Transformers, FLOPs (G)=2.9, Params (M)=23.52021.05 | 21.7 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TNumber of Parameters=28.3M, FLOPs=4.5G2023.03 | 21.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-TGroup=Transformers, FLOPs (G)=4.5, Params (M)=28.32021.05 | 21.6 | — | — | — | — | — | — | — | — | — | — | — | |
| HyCD+LAlignZero-shot=true2025.04 | 21.45 | — | — | — | — | — | — | — | — | — | — | — | |
| TransMix-DeiT-SBackbone=DeiT-S2021.11 | 21.1 | — | 31.2 | — | 28.8 | — | — | — | — | — | — | — | |
| ViT-B/162023.03 | 20.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Diffusion ClassifierResolution=256x2562023.03 | 20 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-SBackbone=DeiT-S2021.11 | 19.1 | — | 32 | — | 23.8 | — | — | — | — | — | — | — | |
| RobustViTBackbone=AR-S, Annotated segmentation=false2022.06 | 19.1 | 42.2 | — | — | — | — | — | — | — | — | — | — | |
| OriginalBackbone=ViT-L, Annotated segmentation=false2022.06 | 19 | 41.5 | — | — | — | — | — | — | — | — | — | — | |
| Right for the Right Reason (RRR)Backbone=ViT-B, Annotated segmentation=true2022.06 | 18.9 | 41.9 | — | — | — | — | — | — | — | — | — | — | |
| DeiT-SGroup=Transformers, FLOPs (G)=4.6, Params (M)=22.12021.05 | 18.9 | — | — | — | — | — | — | — | — | — | — | — |