Image Classification on ImageNet original (val) (Top-1 and Top-5 Accuracy)
83Top-1 AccViTAE-S
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ViTAE-SType=Transformer, Params (M)=23.6, MACs (G)=20.2, Input Size=3842021.06 | 83 | 96.2 | |
| EfficientNet-B4Type=CNN, Params (M)=19.3, MACs (G)=8.4, Input Size=3802021.06 | 82.9 | 96.4 | |
| CeiT-SType=Transformer, Params (M)=24.2, MACs (G)=9, Input Size=2242021.06 | 82 | 95.9 | |
| ViTAE-SType=Transformer, Params (M)=23.6, MACs (G)=5.6, Input Size=2242021.06 | 82 | 95.9 | |
| RegNetY-8GFType=CNN, Params (M)=39.2, MACs (G)=16, Input Size=2242021.06 | 81.7 | — | |
| Twins-SVT-SType=Transformer, Params (M)=24, MACs (G)=5.6, Input Size=2242021.06 | 81.7 | — | |
| CvT-13Type=Transformer, Params (M)=20, MACs (G)=9, Input Size=2242021.06 | 81.6 | — | |
| T2T-ViT-14Type=Transformer, Params (M)=21.5, MACs (G)=5.2, Input Size=2242021.06 | 81.5 | 95.7 | |
| CoE-LargeFLOPs=214M, CondConv=true2021.07 | 81.5 | — | |
| Conformer-TiType=Transformer, Params (M)=23.5, MACs (G)=5.2, Input Size=2242021.06 | 81.3 | — | |
| Swin-TType=Transformer, Params (M)=29, MACs (G)=9, Input Size=2242021.06 | 81.3 | — | |
| ConViT-SType=Transformer, Params (M)=27, MACs (G)=10.8, Input Size=2242021.06 | 81.3 | — | |
| TNT-SType=Transformer, Params (M)=23.8, MACs (G)=10.4, Input Size=2242021.06 | 81.3 | 95.6 | |
| DeiT-S (distilled)Type=Transformer, Params (M)=22.1, MACs (G)=9.8, Input Size=2242021.06 | 81.2 | 95.4 | |
| Twins-PCPVT-SType=Transformer, Params (M)=24.1, MACs (G)=7.4, Input Size=2242021.06 | 81.2 | — | |
| ViTAE-13MType=Transformer, Params (M)=13.2, MACs (G)=3.4, Input Size=2242021.06 | 81 | 95.4 | |
| CrossViT-SType=Transformer, Params (M)=26.7, MACs (G)=11.2, Input Size=2242021.06 | 81 | — | |
| PiT-SType=Transformer, Params (M)=23.5, MACs (G)=4.8, Input Size=2242021.06 | 80.9 | — | |
| CoE-LargeFLOPs=194M, CondConv=false2021.07 | 80.7 | — | |
| S4L MOAMFLOPs=4B, CondConv=false2021.07 | 80.3 | — | |
| ConT-MType=Transformer, Params (M)=19.2, MACs (G)=6.2, Input Size=2242021.06 | 80.2 | — | |
| RegNetY-4GFType=CNN, Params (M)=20.6, MACs (G)=8, Input Size=2242021.06 | 80 | — | |
| OFA-595FLOPs=595M, CondConv=false2021.07 | 80 | — | |
| DeiT-SType=Transformer, Params (M)=22.1, MACs (G)=9.8, Input Size=2242021.06 | 79.9 | 95 | |
| PVT-SType=Transformer, Params (M)=24.5, MACs (G)=7.6, Input Size=2242021.06 | 79.8 | — | |
| ResNeXt-101FLOPs=16B, CondConv=false2021.07 | 79.2 | — | |
| ResNet-152Type=CNN, Params (M)=60.2, MACs (G)=22.6, Input Size=2242021.06 | 78.9 | 94.4 | |
| ResNet-101Type=CNN, Params (M)=44.5, MACs (G)=15.2, Input Size=2242021.06 | 78.3 | 94.1 | |
| LocalViT-PVTType=Transformer, Params (M)=13.5, MACs (G)=9.6, Input Size=2242021.06 | 78.2 | 94.2 | |
| ResNet-152FLOPs=11B, CondConv=false2021.07 | 78.2 | — | |
| PiT-XSType=Transformer, Params (M)=10.6, MACs (G)=2.8, Input Size=2242021.06 | 78.1 | — | |
| ViTAE-6MType=Transformer, Params (M)=6.5, MACs (G)=2, Input Size=2242021.06 | 77.9 | 94.1 | |
| ViTAE-TType=Transformer, Params (M)=4.8, MACs (G)=5.7, Input Size=3842021.06 | 77.2 | 93.8 | |
| EfficientNet-B0Type=CNN, Params (M)=5.3, MACs (G)=0.8, Input Size=2242021.06 | 77.1 | 93.3 | |
| ResNet-50Type=CNN, Params (M)=25.6, MACs (G)=7.6, Input Size=2242021.06 | 76.7 | 93.3 | |
| ConViT-Ti+Type=Transformer, Params (M)=10, MACs (G)=4, Input Size=2242021.06 | 76.7 | — | |
| CeiT-TType=Transformer, Params (M)=6.4, MACs (G)=2.4, Input Size=2242021.06 | 76.4 | 93.4 | |
| ZEROBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 75.52 | — | |
| RegNetY-600MType=CNN, Params (M)=6.1, MACs (G)=1.2, Input Size=2242021.06 | 75.5 | — | |
| ViTAE-TType=Transformer, Params (M)=4.8, MACs (G)=1.5, Input Size=2242021.06 | 75.3 | 92.7 | |
| PVT-TType=Transformer, Params (M)=13.2, MACs (G)=3.8, Input Size=2242021.06 | 75.1 | — | |
| ConT-TiType=Transformer, Params (M)=5.8, MACs (G)=1.6, Input Size=2242021.06 | 74.9 | — | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=full image encoder tuning (Theta_i), Adaptation steps (t)=32024.05 | 74.85 | — | |
| LocalViT-TType=Transformer, Params (M)=5.9, MACs (G)=2.6, Input Size=2242021.06 | 74.8 | 92.6 | |
| MobileNetV2(1.4)Type=CNN, Params (M)=6.9, MACs (G)=0.6, Input Size=2242021.06 | 74.7 | — | |
| DeiT-T (distilled)Type=Transformer, Params (M)=5.7, MACs (G)=2.6, Input Size=2242021.06 | 74.5 | 91.9 | |
| Zero-ShotBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-142024.05 | 73.44 | — | |
| CrossViT-TiType=Transformer, Params (M)=6.9, MACs (G)=3.2, Input Size=2242021.06 | 73.4 | — | |
| RLCFBackbone=CLIP-ViT-B-16 + CLIP-ViT-L-14, Tuning=prompt tuning (Theta_etx), Adaptation steps (t)=12024.05 | 73.23 | — | |
| ConViT-TiType=Transformer, Params (M)=6, MACs (G)=2, Input Size=2242021.06 | 73.1 | — | |
| PiT-TiType=Transformer, Params (M)=4.9, MACs (G)=1.4, Input Size=2242021.06 | 73 | — | |
| LocalViT-T2TType=Transformer, Params (M)=4.3, MACs (G)=2.4, Input Size=2242021.06 | 72.5 | — | |
| MobileNetV1Type=CNN, Params (M)=4.3, MACs (G)=0.6, Input Size=2242021.06 | 72.3 | — | |
| DeiT-TType=Transformer, Params (M)=5.7, MACs (G)=2.6, Input Size=2242021.06 | 72.2 | 91.1 | |
| T2T-ViT-7Type=Transformer, Params (M)=4.3, MACs (G)=1.2, Input Size=2242021.06 | 71.7 | 90.9 | |
| ZEROBackbone=CLIP-ViT-B-16, Ensemble variant=true2024.05 | 71.17 | — | |
| ResNet-18Type=CNN, Params (M)=11.7, MACs (G)=3.6, Input Size=2242021.06 | 70.3 | 86.7 | |
| ZEROBackbone=CLIP-ViT-B-162024.05 | 69.31 | — | |
| TPTBackbone=CLIP-ViT-B-162024.05 | 68.98 | — | |
| EnsembleBackbone=CLIP-ViT-B-162024.05 | 68.34 | — | |
| Zero-ShotBackbone=CLIP-ViT-B-162024.05 | 66.73 | — | |
| LaFTerBackbone=ViT-B/32, Mode=Text-Only Pre-training + Unsupervised Finetuning2023.05 | 64.2 | — | |
| CLIPBackbone=ViT-B/32, Mode=Zero-shot2023.05 | 61.9 | — | |
| UPLBackbone=ViT-B/322023.05 | 61.2 | — | |
| CLIP-PRBackbone=ViT-B/322023.05 | 60.4 | — |