Image Classification on ImageNet (val)
87.1Top-1 AccVOLO-D5
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| VOLO-D5Test Resolution=512 x 512, Model Size=296M, Computations=412B, Architecture=VOLO, Extra Augmentations=Token Labeling [32]2021.06 | 87.1 | — | — | — | — | — | — | — | — | — | — | — | |
| VOLO-D5Test Resolution=448 x 448, Model Size=296M, Computations=304B, Architecture=VOLO, Extra Augmentations=Token Labeling [32]2021.06 | 87 | — | — | — | — | — | — | — | — | — | — | — | |
| NFNet-F5Test Resolution=544 x 544, Model Size=377M, Computations=290B, Architecture=Convolutions, Extra Augmentations=SAM + augmult [15, 16]2021.06 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | |
| CaiTTest Resolution=448 x 448, Model Size=356M, Computations=330B, Architecture=Vision Transformer, Extra Augmentations=Knowledge Distill2021.06 | 86.5 | — | — | — | — | — | — | — | — | — | — | — | |
| NFNet-F6Test Resolution=576 x 576, Model Size=438M, Computations=377B, Architecture=Convolutions, Extra Augmentations=SAM [15]2021.06 | 86.5 | — | — | — | — | — | — | — | — | — | — | — | |
| LV-VITTest Resolution=448 x 448, Model Size=140M, Computations=157B, Architecture=Vision Transformer, Extra Augmentations=Token Labeling [32]2021.06 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | |
| FixRes ResNeXt-101 32x48dExtra Training Data=true, Train resolution=224, Test resolution=320, # Parameters=829M, Evaluation protocol=Single Crop evaluation2019.06 | 86.4 | 98 | — | — | — | — | — | — | — | — | — | — | |
| DHOStudent Model=ViT-L/14, Params (M)=304M, Labeled Data=10%, Teacher Model=ViT-H/142025.05 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | |
| MAEType=Masked, Params=632M2024.12 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 32x48dExtra Training Data=true, Train resolution=224, Test resolution=224, # Parameters=829M, Evaluation protocol=Single Crop evaluation2019.06 | 85.4 | 97.6 | — | — | — | — | — | — | — | — | — | — | |
| UniNet-B5Family=Hybrid, Input Size=384, #FLOPS (G)=23.2, #Params (M)=73.52021.10 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | |
| EffNetV2-MFamily=Convolution, Input Size=480, #FLOPS (G)=24, #Params (M)=54, progressive learning=true2021.10 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | |
| NFNet-F2Family=Convolution, Input Size=352, #FLOPS (G)=62.6, #Params (M)=193.82021.10 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 32x32dExtra Training Data=true, Train resolution=224, Test resolution=224, # Parameters=466M, Evaluation protocol=Single Crop evaluation2019.06 | 85.1 | 97.5 | — | — | — | — | — | — | — | — | — | — | |
| RandAugmentBackbone=EfficientNet-B72019.09 | 85 | 97.2 | — | — | — | — | — | — | — | — | — | — | |
| BoTNet-T7Family=Transformer, Input Size=384, #FLOPS (G)=45.8, #Params (M)=75.12021.10 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | |
| DHOStudent Model=ViT-L/14, Params (M)=304M, Labeled Data=1%, Teacher Model=ViT-H/142025.05 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Full-precisionNetwork=ViT-B, #Bits=32/32, Size (MB)=346.32024.11 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugmentBackbone=EfficientNet-B72019.09 | 84.4 | 97.1 | — | — | — | — | — | — | — | — | — | — | |
| SupervisedArch.=EffNet-B7, Param.=66, Protocol=Supervised training2020.06 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Extra Training Data=false, Train resolution=600, Test resolution=600, # Parameters=66M, Evaluation protocol=Single Crop evaluation2019.06 | 84.4 | 97.1 | — | — | — | — | — | — | — | — | — | — | |
| EffNet-B7Family=Convolution, Input Size=600, #FLOPS (G)=37, #Params (M)=662021.10 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | |
| AmoebaNet-B (6,512)Extra Training Data=false, Train resolution=480, Test resolution=480, # Parameters=577M, Evaluation protocol=Single Crop evaluation2019.06 | 84.3 | 97 | — | — | — | — | — | — | — | — | — | — | |
| MAGEType=Masked, Params=328M2024.12 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | |
| SEERPre-training Data=IG, Pre-training Images count=1B, Architecture=RG256, Number of Parameters=1.3B, Fine-tuning=ImageNet2021.03 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | |
| UniNet-B4Family=Hybrid, Input Size=256, #FLOPS (G)=9.9, #Params (M)=73.52021.10 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 32x16dExtra Training Data=true, Train resolution=224, Test resolution=224, # Parameters=193M, Evaluation protocol=Single Crop evaluation2019.06 | 84.2 | 97.2 | — | — | — | — | — | — | — | — | — | — | |
| RepQ-ViT + QwTNetwork=ViT-B, #Bits=6/6, Size (MB)=80.4, Finetuned (1 epoch)=true2024.11 | 84 | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineBackbone=EfficientNet-B72019.09 | 84 | 96.9 | — | — | — | — | — | — | — | — | — | — | |
| CrossFormer-L#Params=92.0M, FLOPs=16.1G, Input Size=224x2242021.07 | 84 | — | — | — | — | — | — | — | — | — | — | — | |
| ACDIT-XLType=Generative, Params=677M2024.12 | 84 | — | — | — | — | — | — | — | — | — | — | — | |
| RepQ-ViT + QwTNetwork=ViT-B, #Bits=6/6, Size (MB)=80.4, Finetuned (1 epoch)=false2024.11 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | |
| RandAugmentBackbone=EfficientNet-B52019.09 | 83.9 | 96.8 | — | — | — | — | — | — | — | — | — | — | |
| IGQ-ViTNetwork=ViT-B, #Bits=6/62024.11 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| SEERPre-training Data=IG, Pre-training Images count=1B, Architecture=RG128, Number of Parameters=693M, Fine-tuning=ImageNet2021.03 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| NesT-B#Params=68.0M, FLOPs=17.9G, Input Size=224x2242021.07 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| UniNet-B3Family=Hybrid, Input Size=256, #FLOPS (G)=4.2, #Params (M)=31.82021.10 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | |
| FixRes PNASNet-5Extra Training Data=false, Train resolution=331, Test resolution=480, # Parameters=86.1M, Evaluation protocol=Single Crop evaluation2019.06 | 83.7 | 96.8 | — | — | — | — | — | — | — | — | — | — | |
| RepQ-ViTNetwork=ViT-B, #Bits=6/6, Size (MB)=66.22024.11 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-HParams (M)=632M, Labeled Data=zero-shot2025.05 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| NFNet-F0Family=Convolution, Input Size=256, #FLOPS (G)=12.4, #Params (M)=71.52021.10 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| MultiGrain PNASNet @ 500pxExtra Training Data=false, Train resolution=331, Test resolution=500, # Parameters=86.1M, Evaluation protocol=Single Crop evaluation2019.06 | 83.6 | 96.7 | — | — | — | — | — | — | — | — | — | — | |
| Swin-BFamily=Transformer, Input Size=224, #FLOPS (G)=15.4, #Params (M)=882021.10 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-S w OursTransformer Family=Swin Transformer, #Parameters=49.8M, Throughput (image/s)=401.5, Input size=224 x 224, GPU=Tesla V1002021.10 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| CrossFormer-B#Params=52.0M, FLOPs=9.2G, Input Size=224x2242021.07 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | |
| AutoAugmentBackbone=EfficientNet-B52019.09 | 83.3 | 96.7 | — | — | — | — | — | — | — | — | — | — | |
| NesT-S#Params=38.0M, FLOPs=10.4G, Input Size=224x2242021.07 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| RegionViT-B#Params=72.0M, FLOPs=13.3G, Input Size=224x2242021.07 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Twins-SVT-L#Params=99.2M, FLOPs=14.8G, Input Size=224x2242021.07 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-B#Params=88.0M, FLOPs=15.4G, Input Size=224x2242021.07 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| CvT-21Family=Hybrid, Input Size=384, #FLOPS (G)=24.9, #Params (M)=322021.10 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-BTransformer Family=Swin Transformer, #Parameters=88M, Throughput (image/s)=273.1, Input size=224 x 224, GPU=Tesla V1002021.10 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineBackbone=EfficientNet-B52019.09 | 83.2 | 96.7 | — | — | — | — | — | — | — | — | — | — | |
| ViL-B#Params=55.7M, FLOPs=13.4G, Input Size=224x2242021.07 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | |
| SimCLRv2Pre-training Data=ImageNet, Pre-training Images count=1.2M, Architecture=RN152w3+SK, Number of Parameters=795M, Fine-tuning=ImageNet2021.03 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | |
| RegionViT-M#Params=41.2M, FLOPs=7.4G, Input Size=224x2242021.07 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Twins-SVT-B#Params=56.0M, FLOPs=8.3G, Input Size=224x2242021.07 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-B#Params=86.0M, FLOPs=55.4G, Input Size=384x3842021.07 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-HType=Supervised, Params=632M2024.12 | 83.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-S#Params=50.0M, FLOPs=8.7G, Input Size=224x2242021.07 | 83 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-STransformer Family=Swin Transformer, #Parameters=49.6M, Throughput (image/s)=423.8, Input size=224 x 224, GPU=Tesla V1002021.10 | 83 | — | — | — | — | — | — | — | — | — | — | — | |
| EffNet-B4Family=Convolution, Input Size=380, #FLOPS (G)=4.2, #Params (M)=192021.10 | 82.9 | — | — | — | — | — | — | — | — | — | — | — | |
| PNASNet-5 (N = 4, F = 216)Extra Training Data=false, Train resolution=331, Test resolution=331, # Parameters=86.1M, Evaluation protocol=Single Crop evaluation2019.06 | 82.9 | 96.2 | — | — | — | — | — | — | — | — | — | — | |
| DHOStudent Model=ViT-B/16, Params (M)=86M, Labeled Data=10%, Teacher Model=ViT-H/142025.05 | 82.8 | — | — | — | — | — | — | — | — | — | — | — | |
| CAT-B#Params=52.0M, FLOPs=8.9G, Input Size=224x2242021.07 | 82.8 | — | — | — | — | — | — | — | — | — | — | — | |
| DiT-XLType=Generative, Params=675M2024.12 | 82.8 | — | — | — | — | — | — | — | — | — | — | — | |
| SENetimage size=320x320, # parameters=145.8 M, Mult-Adds=42.3 B2017.07 | 82.7 | 96.2 | — | — | — | — | — | — | — | — | — | — | |
| NASNet-A (6 @ 4032)image size=331x331, # parameters=88.9 M, Mult-Adds=23.8 B2017.07 | 82.7 | 96.2 | — | — | — | — | — | — | — | — | — | — | |
| UniNet-B2Family=Hybrid, Input Size=224, #FLOPS (G)=2.4, #Params (M)=22.52021.10 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | |
| ReLabelArchitecture=EfficientNet-B3, Params=12.2M, Flops=1.8B2021.01 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RegionViT-S#Params=30.6M, FLOPs=5.3G, Input Size=224x2242021.07 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | |
| CrossFormer-S#Params=30.7M, FLOPs=4.9G, Input Size=224x2242021.07 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | |
| CvT-21#Params=32.0M, FLOPs=7.1G, Input Size=224x2242021.07 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | |
| ConViT-B+Family=Hybrid, Input Size=224, #FLOPS (G)=30, #Params (M)=1522021.10 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | |
| FixRes ResNet-50 Billion-scale@224Extra Training Data=true, Train resolution=224, Test resolution=320, # Parameters=25.6M, Evaluation protocol=Single Crop evaluation2019.06 | 82.5 | 96.6 | — | — | — | — | — | — | — | — | — | — | |
| DeiT-B w OursTransformer Family=ViT family, #Parameters=86.7M, Throughput (image/s)=259.1, Input size=224 x 224, GPU=Tesla V1002021.10 | 82.4 | — | — | — | — | — | — | — | — | — | — | — | |
| CVT-13-NASFamily=Hybrid, Input Size=224, #FLOPS (G)=4.1, #Params (M)=182021.10 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | |
| ResNeXt-101 32x8dExtra Training Data=true, Train resolution=224, Test resolution=224, # Parameters=88M, Evaluation protocol=Single Crop evaluation2019.06 | 82.2 | 96.4 | — | — | — | — | — | — | — | — | — | — | |
| EffNetV2-B3Family=Convolution, Input Size=300, #FLOPS (G)=3, #Params (M)=14, progressive learning=true2021.10 | 82.1 | — | — | — | — | — | — | — | — | — | — | — | |
| TResNet-XLTop Training Speed (img/sec)=250, Top Inference Speed (img/sec)=1060, Max Train Batch Size=240, Input Resolution=224, GPU=Nvidia V100, Precision=mixed precision2020.03 | 82 | — | — | — | — | — | — | — | — | — | — | — | |
| SwAVPre-training Data=IG, Pre-training Images count=1B, Architecture=RX101-32x16d, Number of Parameters=182M, Fine-tuning=ImageNet2021.03 | 82 | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-T w OursTransformer Family=Swin Transformer, #Parameters=28.5M, Throughput (image/s)=708.4, Input size=224 x 224, GPU=Tesla V1002021.10 | 82 | — | — | — | — | — | — | — | — | — | — | — | |
| T2T-ViT-14 w OursTransformer Family=Token-to-Token, #Parameters=21.7M, Input size=224 x 224, GPU=Tesla V1002021.10 | 81.9 | — | — | — | — | — | — | — | — | — | — | — | |
| FixRes ResNet-50 Billion-scale@160Extra Training Data=true, Train resolution=160, Test resolution=224, # Parameters=25.6M, Evaluation protocol=Single Crop evaluation2019.06 | 81.9 | 96.1 | — | — | — | — | — | — | — | — | — | — | |
| CAT-S#Params=37.0M, FLOPs=5.9G, Input Size=224x2242021.07 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | |
| ViL-S#Params=24.6M, FLOPs=4.9G, Input Size=224x2242021.07 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-B#Params=86.0M, FLOPs=17.5G, Input Size=224x2242021.07 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BTransformer Family=ViT family, #Parameters=86.6M, Throughput (image/s)=285.4, Input size=224 x 224, GPU=Tesla V1002021.10 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | |
| MEAL V2Resolution=380, #Params=25.6M, Backbone=ResNet-502020.09 | 81.72 | 95.81 | — | — | — | — | — | — | — | — | — | — | |
| VanillaArchitecture=EfficientNet-B3, Params=12.2M, Flops=1.8B2021.01 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | |
| BoTNet-S1-59#Params=33.5M, FLOPs=7.3G, Input Size=224x2242021.07 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | |
| PVT-L#Params=61.4M, FLOPs=9.8G, Input Size=224x2242021.07 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | |
| FKDBackbone=ResNet-1012021.12 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | |
| DHOStudent Model=ViT-B/16, Params (M)=86M, Labeled Data=1%, Teacher Model=ViT-H/142025.05 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | |
| CvT-13#Params=20.0M, FLOPs=4.5G, Input Size=224x2242021.07 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | |
| ResT#Params=30.2M, FLOPs=4.3G, Input Size=224x2242021.07 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | |
| EffNet-B3Family=Convolution, Input Size=300, #FLOPS (G)=1.8, #Params (M)=122021.10 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | |
| DPN-131image size=320x320, # parameters=79.5 M, Mult-Adds=32.0 B2017.07 | 81.5 | 95.8 | — | — | — | — | — | — | — | — | — | — | |
| TResNet-LTop Training Speed (img/sec)=345, Top Inference Speed (img/sec)=1390, Max Train Batch Size=316, Input Resolution=224, GPU=Nvidia V100, Precision=mixed precision2020.03 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | |
| CrossFormer-T#Params=27.8M, FLOPs=2.9G, Input Size=224x2242021.07 | 81.5 | — | — | — | — | — | — | — | — | — | — | — |