Image Classification on ImageNet 1k (test)
91Top-1 AccuracyModel Soups
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Model SoupsExtra Data=JFT-3B, Image Size=500^22022.08 | 91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoCaExtra Data=JFT-3B, Image Size=576^22022.08 | 91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-7Extra Data=JFT-3B, Image Size=512^22022.08 | 90.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-GExtra Data=JFT-3B, Image Size=518^22022.08 | 90.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GExtra Data=IN-22K-ext-70M, Image Size=640^22022.08 | 90.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3Extra Data=IN-21K, Image Size=336^22022.08 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FD-CLIPExtra Data=IN-21K, Image Size=336^22022.08 | 89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NewtonEpsilon=inf, Epochs=10, Pretraining DS=JFT2022.11 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MViTv2Extra Data=IN-21K, Image Size=512^22022.08 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViTExtra Data=IN-21K, Image Size=512^22022.08 | 88.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEITExtra Data=IN-21K, Image Size=512^22022.08 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-4Extra Data=IN-21K, Image Size=512^22022.08 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT L/16Pre-training Dataset=JFT 3B, Pretrain Resolution=224, Finetune Resolution=384, FLOPs (B)=191.52023.04 | 88.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNICOM (ViT L/14)Pre-training Dataset=LAION 400M, Pretrain Resolution=224, Finetune Resolution=518, FLOPs (B)=507.82023.04 | 88.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT L/16Pre-training Dataset=IG 3.6B, Pretrain Resolution=224, Finetune Resolution=512, FLOPs (B)=362.92023.04 | 88.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-FCEpsilon=8, Epochs=10, Pretraining DS=JFT2022.11 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT L/16Pre-training Dataset=JFT 300M, Pretrain Resolution=224, Finetune Resolution=512, FLOPs (B)=362.92023.04 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-FCEpsilon=4, Epochs=10, Pretraining DS=JFT2022.11 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT L/14 OPEN-CLIPPre-training Dataset=LAION 400M, Pretrain Resolution=224, Finetune Resolution=518, FLOPs (B)=507.82023.04 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-FCEpsilon=2, Epochs=10, Pretraining DS=JFT2022.11 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP (transfer setup)data=WIT-400M, epochs=32, model=L/14, protocol=fine-tune, image size=224, optimizer=SGD2022.12 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vanilla FTPre-trained=CLIP, Backbone=ViT-L, Protocol=Fine-Tuning2023.03 | 87.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.25 | 83.25 | 0 | — | — | — | — | — | — | — | — | |
| TPGMPre-trained=CLIP, Backbone=ViT-L, Protocol=Proposed2023.03 | 87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.81 | 83.41 | 0.19 | — | — | — | — | — | — | — | — | |
| FLIPdata=LAION-400M, epochs=32, model=L/16, protocol=fine-tune, image size=2242022.12 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAESource=Reference [29]2023.02 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-FCEpsilon=1, Epochs=10, Pretraining DS=JFT2022.11 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-LEval size=512, Params=212M, FLOPs=245.4G, Throughput (image/s)=17.82022.04 | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Previous SOTA (De et al., 2022)Epsilon=82022.11 | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-BEval size=512, Params=120M, FLOPs=138.5G, Throughput (image/s)=24.02022.04 | 86.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-LEval size=384, Params=212M, FLOPs=133.1G, Throughput (image/s)=34.32022.04 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-BEval size=384, Params=120M, FLOPs=74.2G, Throughput (image/s)=45.82022.04 | 86.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP (our reproduction)data=LAION-400M, epochs=32, model=L/16, protocol=fine-tune, image size=2242022.12 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenCLIPdata=LAION-400M, epochs=32, model=L/14, protocol=fine-tune, image size=2242022.12 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-SEval size=512, Params=69M, FLOPs=67.6G, Throughput (image/s)=43.32022.04 | 86.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-FCEpsilon=0.5, Epochs=10, Pretraining DS=JFT2022.11 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TPGM-CPre-trained=CLIP, Backbone=ViT-L, Protocol=Proposed (Controlled)2023.03 | 86.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.83 | 82.43 | -0.99 | — | — | — | — | — | — | — | — | |
| CoAtNet-3Eval size=512, Params=168M, FLOPs=203.1G, Throughput (image/s)=22.42022.04 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Previous SOTA (De et al., 2022)Epsilon=42022.11 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEBackbone=ViT-L, # Params=307M, PT Epoch=1600, GPU Hours/Ep.=1.7, Total GPU Hours=2720, Resolution=224x2242023.03 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UNICOM (ViT B/16)Pre-training Dataset=LAION 400M, Pretrain Resolution=224, Finetune Resolution=384, FLOPs (B)=55.62023.04 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iFormer-L↑384#Param. (M)=87, FLOPs (G)=45.3, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-3Eval size=384, Params=168M, FLOPs=107.4G, Throughput (image/s)=48.52022.04 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocalMIM-HOGBackbone=ViT-L, # Params=307M, PT Epoch=800, GPU Hours/Ep.=1, Total GPU Hours=800, Resolution=224x2242023.03 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-SEval size=384, Params=69M, FLOPs=36.1G, Throughput (image/s)=82.72022.04 | 85.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-TEval size=512, Params=31M, FLOPs=33.7G, Throughput (image/s)=63.82022.04 | 85.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugment with Knowledge DistillationTeacher Network=EfficientNet-B7*, Student Network=EfficientNet-B82020.03 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iFormer-B↑384#Param. (M)=48, FLOPs (G)=30.5, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNetV2-L#Param. (M)=121, FLOPs (G)=53, Input Size (Train)=480x480, Input Size (Test)=480x4802022.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-2↑384#Param. (M)=75, FLOPs (G)=49.8, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GC ViT-LParam (M)=201, FLOPs (G)=32.6, Image Size=224^22022.06 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Previous SOTA (De et al., 2022)Epsilon=22022.11 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocalMIM-HOGBackbone=Swin-L, # Params=197M, PT Epoch=800, GPU Hours/Ep.=1.6, Total GPU Hours=1280, Resolution=224x2242023.03 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugment with Knowledge DistillationTeacher Network=EfficientNet-B7, Student Network=EfficientNet-B72020.03 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdvPropTeacher Network=EfficientNet-B7*, Student Network=EfficientNet-B82020.03 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-L2Source=Reference [112]2023.02 | 85.5 | — | — | 97.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RandAugmentTeacher Network=EfficientNet-B7*, Student Network=EfficientNet-B82020.03 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimMIMBackbone=Swin-L, P-Size=192x192, EP-Size=192x1922022.05 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSwin-B↑384#Param. (M)=78, FLOPs (G)=47.0, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSwin-BEval size=384, Params=78M, FLOPs=47.0G2022.04 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimMIM192Backbone=Swin-L, # Params=197M, PT Epoch=800, GPU Hours/Ep.=3, Total GPU Hours=2400, Resolution=192x1922023.03 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT B/16 OPEN-CLIPPre-training Dataset=LAION 400M, Pretrain Resolution=224, Finetune Resolution=384, FLOPs (B)=55.62023.04 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BootlegArch=ViT-L/16, Pre-training Data=IN-1k, Pre-training Epochs=600, Fine-tuning Protocol=Full-FT, Training Data Percentage=100%2026.03 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WISEPre-trained=CLIP, Backbone=ViT-L, Protocol=Weight Interpolation2023.03 | 85.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.5 | 81.92 | -1.6 | — | — | — | — | — | — | — | — | |
| UM-MAEBackbone=Swin-L, P-Size=256x256, EP-Size=128x1282022.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTAEv2-B↑384#Param. (M)=90, FLOPs (G)=74.4, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT B/16Pre-training Dataset=IG 3.6B, Pretrain Resolution=224, Finetune Resolution=384, FLOPs (B)=55.62023.04 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-TEval size=384, Params=31M, FLOPs=17.7G, Throughput (image/s)=121.92022.04 | 85.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdvPropTeacher Network=EfficientNet-B7, Student Network=EfficientNet-B72020.03 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT L/16Pre-training Dataset=IN-21k, Pretrain Resolution=224, Finetune Resolution=384, FLOPs (B)=191.52023.04 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-LEval size=224, Params=212M, FLOPs=43.9G, Throughput (image/s)=99.42022.04 | 85.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNetV2-M#Param. (M)=54, FLOPs (G)=25.0, Input Size (Train)=480x480, Input Size (Test)=480x4802022.05 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-1↑384#Param. (M)=42, FLOPs (G)=27.4, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EffNetV2-MEval size=480, Params=55M, FLOPs=24.0G, Throughput (image/s)=280.72022.04 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GreenMIMBackbone=Swin-L, # Params=197M, PT Epoch=800, GPU Hours/Ep.=1.4, Total GPU Hours=1120, Resolution=224x2242023.03 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-LParam (M)=212, FLOPs (G)=43.9, Image Size=224^22022.06 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RandAugmentTeacher Network=EfficientNet-B7, Student Network=EfficientNet-B72020.03 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSwin-S↑384#Param. (M)=35, FLOPs (G)=22.0, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GC ViT-BParam (M)=90, FLOPs (G)=14.8, Image Size=224^22022.06 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-BEval size=224, Params=120M, FLOPs=23.4G, Throughput (image/s)=133.62022.04 | 84.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RandAugment (reproduced)Teacher Network=EfficientNet-B7, Student Network=EfficientNet-B7, Implementation=PyTorch2020.03 | 84.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-BParam (M)=120, FLOPs (G)=74.2, Image Size=224^22022.06 | 84.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugmentTeacher Network=EfficientNet-B7*, Student Network=EfficientNet-B82020.03 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QnA-BaseParams=56M, GFLOPS=30.6, Throughput=177, Resolution=384x384, fine-tuned=true2021.12 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GC ViT-S2Param (M)=68, FLOPs (G)=10.7, Image Size=224^22022.06 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTAEv2-48M↑384#Param. (M)=49, FLOPs (G)=41.1, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NFNet-F1Eval size=320, Params=132M, FLOPs=35.5G, Throughput (image/s)=228.52022.04 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEArch=ViT-L/16, Pre-training Data=IN-1k, Pre-training Epochs=1600, Fine-tuning Protocol=Full-FT, Training Data Percentage=100%2026.03 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iFormer-S↑384#Param. (M)=20, FLOPs (G)=16.1, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-BParam (M)=88, FLOPs (G)=15.1, Image Size=256^22022.06 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugmentTeacher Network=EfficientNet-B7, Student Network=EfficientNet-B72020.03 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BaseParams=88M, GFLOPS=47.0, Throughput=85, Resolution=384x384, fine-tuned=true2021.12 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CaiT-M24Eval size=384, Params=186M, FLOPs=116.1G2022.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BEval size=384, Params=88M, FLOPs=47.0G, Throughput (image/s)=84.72022.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-3Eval size=224, Params=168M, FLOPs=34.7G, Throughput (image/s)=163.32022.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PeCoBackbone=ViT-B, # Params=86M, PT Epoch=800, Resolution=224x2242023.03 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoAtNet-3Param (M)=168, FLOPs (G)=34.7, Image Size=224^22022.06 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-SEval size=224, Params=69M, FLOPs=11.7G, Throughput (image/s)=242.52022.04 | 84.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Previous SOTA (De et al., 2022)Epsilon=12022.11 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MaxViT-SParam (M)=69, FLOPs (G)=11.7, Image Size=224^22022.06 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSwin-T↑384#Param. (M)=23, FLOPs (G)=14.0, Input Size (Train)=224x224, Input Size (Test)=384x3842022.05 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |