Image Classification on ImageNet-1K 1.0 (val)
90Top-1 AccuracyRevCol-H
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RevCol-HImage Size=640x640, Params (M)=2158, FLOPs (G)=2537, Pre-training Dataset=168M semi-labeled2022.12 | 90 | — | |
| CoAtNet-5Eval size=512, Params=688M, FLOPs=812G, Pre-training=JFT2022.04 | 89.77 | — | |
| MaxViT-XLEval size=512, Params=475M, FLOPs=535.2G, Pre-training=JFT2022.04 | 89.53 | — | |
| MaxViT-LEval size=512, Params=212M, FLOPs=245.2G, Pre-training=JFT2022.04 | 89.41 | — | |
| RevCol-XLImage Size=384x384, Params (M)=834, FLOPs (G)=350.0, Pre-training Dataset=168M semi-labeled2022.12 | 89.4 | — | |
| MaxViT-XLEval size=384, Params=475M, FLOPs=293.7G, Pre-training=JFT2022.04 | 89.36 | — | |
| NFNet-F4+Eval size=512, Params=527M, FLOPs=367G, Pre-training=JFT2022.04 | 89.2 | — | |
| MaxViT-LEval size=384, Params=212M, FLOPs=128.7G, Pre-training=JFT2022.04 | 89.12 | — | |
| CoAtNet-4Eval size=512, Params=275M, FLOPs=360.9G, Pre-training=JFT2022.04 | 89.11 | — | |
| MOAT-4eval size=512x512, params=483.2M, FLOPS=648.5B, pre-training=ImageNet-22K pretraining2022.10 | 89.1 | — | |
| FD-CLIP*Backbone=ViT-L, Resolution=336x336, Feature Distillation=true, Evaluation Protocol=fine-tuning, intermediate fine-tuning=ImageNet-22K2022.05 | 89 | — | |
| MaxViT-BEval size=512, Params=119M, FLOPs=138.3G, Pre-training=JFT2022.04 | 88.82 | — | |
| CoAtNet-3Eval size=512, Params=168M, FLOPs=203.1G, Pre-training=JFT2022.04 | 88.81 | — | |
| MViTv2-Heval size=512x512, params=667M, FLOPS=763.5B, pre-training=ImageNet-22K pretraining2022.10 | 88.8 | — | |
| MaxViT-XLEval size=512, Params=475M, FLOPs=535.2G, Pre-training=ImageNet-21K2022.04 | 88.7 | — | |
| MaxViT-XLeval size=512x512, params=475M, FLOPS=535.2B, pre-training=ImageNet-22K pretraining2022.10 | 88.7 | — | |
| MaxViT-BEval size=384, Params=119M, FLOPs=74.2G, Pre-training=JFT2022.04 | 88.69 | — | |
| CoAtNet-4eval size=512x512, params=275M, FLOPS=360.9B, pre-training=ImageNet-22K pretraining2022.10 | 88.6 | — | |
| MAELoss Function=dVAE-P, Pre-training Data=IN1K + DALL-E, Backbone=ViT-L, Evaluation Protocol=Fine-tuning2022.12 | 88.6 | — | |
| ViT-H/14Eval size=518, Params=632M, FLOPs=1021G, Pre-training=JFT2022.04 | 88.55 | — | |
| MaxViT-XLEval size=384, Params=475M, FLOPs=293.7G, Pre-training=ImageNet-21K2022.04 | 88.51 | — | |
| ViTAE-H#Params=644 M, Test size=448, Pre-training/Method=MAE, Fine-tuned on ImageNet-22K=true2022.02 | 88.5 | — | |
| MaxViT-LEval size=512, Params=212M, FLOPs=245.2G, Pre-training=ImageNet-21K2022.04 | 88.46 | — | |
| MOAT-3eval size=512x512, params=190.0M, FLOPS=271.0B, pre-training=ImageNet-22K pretraining2022.10 | 88.4 | — | |
| MaxViT-BEval size=512, Params=119M, FLOPs=138.3G, Pre-training=ImageNet-21K2022.04 | 88.38 | — | |
| MaxViT-LEval size=384, Params=212M, FLOPs=128.7G, Pre-training=ImageNet-21K2022.04 | 88.32 | — | |
| ViTAE-L#Params=311 M, Test size=384, Pre-training/Method=MAE, Fine-tuned on ImageNet-22K=true2022.02 | 88.3 | — | |
| MaxViT-BEval size=384, Params=119M, FLOPs=74.2G, Pre-training=ImageNet-21K2022.04 | 88.24 | — | |
| MOAT-3eval size=384x384, params=190.0M, FLOPS=141.2B, pre-training=ImageNet-22K pretraining2022.10 | 88.2 | — | |
| RevCol-XLImage Size=384x384, Params (M)=834, FLOPs (G)=350.0, Pre-training Dataset=ImageNet-22K2022.12 | 88.2 | — | |
| CoAtNet-4Eval size=512, Params=275M, FLOPs=360.9G, Pre-training=ImageNet-21K2022.04 | 88.1 | — | |
| MSG-MAELoss Function=StyleGANv2-ADA-P, Pre-training Data=IN1K, Backbone=ViT-L, Evaluation Protocol=Fine-tuning2022.12 | 88.1 | — | |
| ViTAE-H#Params=644 M, Test size=224, Pre-training/Method=MAE, Fine-tuned on ImageNet-22K=true2022.02 | 88 | — | |
| dBOTBackbone=ViT-H, Resolution=448, Evaluation Protocol=Fine-tuned2022.09 | 88 | — | |
| CoAtNet-4Eval size=384, Params=275M, FLOPs=189.5G, Pre-training=ImageNet-21K2022.04 | 87.9 | — | |
| CoAtNet-3Eval size=512, Params=168M, FLOPs=203.1G, Pre-training=ImageNet-21K2022.04 | 87.9 | — | |
| CoAtNet-4#Params=275 M, Test size=384, Pre-training/Method=Supervised, Fine-tuned on ImageNet-22K=true2022.02 | 87.9 | — | |
| ConvNeXt-XLEval size=384, Params=350M, FLOPs=179.0G, Pre-training=ImageNet-21K2022.04 | 87.8 | — | |
| ViTAE-H#Params=644 M, Test size=512, Pre-training/Method=MAE2022.02 | 87.8 | — | |
| ConvNeXt-XLeval size=384x384, params=350M, FLOPS=179.0B, pre-training=ImageNet-22K pretraining2022.10 | 87.8 | — | |
| ConvNeXt-XLImage Size=384x384, Params (M)=350, FLOPs (G)=179.0, Pre-training Dataset=ImageNet-22K2022.12 | 87.8 | — | |
| MAEBackbone=ViT-H, Resolution=448, Evaluation Protocol=Fine-tuned2022.09 | 87.8 | — | |
| ViT-L/16Eval size=512, Params=305M, FLOPs=364G, Pre-training=JFT2022.04 | 87.76 | — | |
| FD-CLIPBackbone=ViT-L, Resolution=224x224, Feature Distillation=true, Evaluation Protocol=fine-tuning2022.05 | 87.7 | — | |
| SwinV2-LEval size=384, Params=197M, Pre-training=ImageNet-21K2022.04 | 87.7 | — | |
| CvT-W24Eval size=384, Params=277M, FLOPs=193.2G, Pre-training=ImageNet-21K2022.04 | 87.7 | — | |
| HorNet-LGF (384 resolution)Image Size=384x384, Params (M)=202, FLOPs (G)=101.8, Pre-training=ImageNet-22K, Fine-tuning=384x384 for 30 epochs2022.07 | 87.7 | — | |
| SwinV2-L#Params=197 M, Test size=384, Pre-training/Method=Supervised, Fine-tuned on ImageNet-22K=true2022.02 | 87.7 | — | |
| CvT-W24#Params=277 M, Test size=384, Pre-training/Method=Supervised, Fine-tuned on ImageNet-22K=true2022.02 | 87.7 | — | |
| SwinV2-Leval size=384x384, params=197M, FLOPS=115.4B, pre-training=ImageNet-22K pretraining2022.10 | 87.7 | — | |
| MOAT-2eval size=512x512, params=73.4M, FLOPS=104.6B, pre-training=ImageNet-22K pretraining2022.10 | 87.7 | — | |
| CoAtNet-3Eval size=384, Params=168M, FLOPs=107.4G, Pre-training=ImageNet-21K2022.04 | 87.6 | — | |
| SwinV2-LImage Size=384x384, Params (M)=197, FLOPs (G)=115.4, Pre-training=ImageNet-22K2022.07 | 87.6 | — | |
| HorNet-L7x7 (384 resolution)Image Size=384x384, Params (M)=195, FLOPs (G)=102.3, Pre-training=ImageNet-22K, Fine-tuning=384x384 for 30 epochs2022.07 | 87.6 | — | |
| CoAtNet-3eval size=384x384, params=168M, FLOPS=107.4B, pre-training=ImageNet-22K pretraining2022.10 | 87.6 | — | |
| RevCol-LImage Size=384x384, Params (M)=273, FLOPs (G)=116.0, Pre-training Dataset=ImageNet-22K2022.12 | 87.6 | — | |
| ConvNeXt-LEval size=384, Params=198M, FLOPs=101.0G, Pre-training=ImageNet-21K2022.04 | 87.5 | — | |
| CSwin-LEval size=384, Params=173M, FLOPs=96.8G, Pre-training=ImageNet-21K2022.04 | 87.5 | — | |
| CSWin-LImage Size=384x384, Params (M)=173, FLOPs (G)=96.8, Pre-training=ImageNet-22K2022.07 | 87.5 | — | |
| ConvNeXt-L (384 resolution)Image Size=384x384, Params (M)=198, FLOPs (G)=101.0, Pre-training=ImageNet-22K, Fine-tuning=384x384 for 30 epochs2022.07 | 87.5 | — | |
| ViTAE-L#Params=311 M, Test size=224, Pre-training/Method=MAE, Fine-tuned on ImageNet-22K=true2022.02 | 87.5 | — | |
| ConvNeXt-Leval size=384x384, params=198M, FLOPS=101.0B, pre-training=ImageNet-22K pretraining2022.10 | 87.5 | — | |
| CSwin-Leval size=384x384, params=173M, FLOPS=96.8B, pre-training=ImageNet-22K pretraining2022.10 | 87.5 | — | |
| MOAT-2eval size=384x384, params=73.4M, FLOPS=54.3B, pre-training=ImageNet-22K pretraining2022.10 | 87.5 | — | |
| ConvNeXt-LImage Size=384x384, Params (M)=198, FLOPs (G)=101.0, Pre-training Dataset=ImageNet-22K2022.12 | 87.5 | — | |
| ConvNeXt-LResolution=384x384, Params=198 M, FLOPs=101.1 G, Throughput=221 imgs/sec, Peak Memory=19.2 GB, Pre-training=ImageNet-22K2022.09 | 87.5 | — | |
| DiNAT-L†Resolution=384x384, Params=200 M, FLOPs=92.4 G, Throughput=110 imgs/sec, Peak Memory=26.9 GB, Pre-training=ImageNet-22K, Window size=11x112022.09 | 87.5 | — | |
| ConvNeXt-LWin. Size=7^2, # of Params=198 M, FLOPs=101.1 G, Thru. (imgs/sec)=221, Memory (GB)=19.2, Resolution=384x384, Batch size=256, Hardware=NVIDIA A1002022.09 | 87.5 | — | |
| DINAT-LWin. Size=11^2, # of Params=200 M, FLOPs=92.4 G, Thru. (imgs/sec)=110, Memory (GB)=26.9, Resolution=384x384, Batch size=256, Hardware=NVIDIA A1002022.09 | 87.5 | — | |
| UniNet-B6Family=H, Input Size=448, #FLOPs (G)=51, #Params (M)=117, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87.4 | — | |
| DiNATs-LResolution=384x384, Params=197 M, FLOPs=101.5 G, Throughput=181 imgs/sec, Peak Memory=22.6 GB, Pre-training=ImageNet-22K2022.09 | 87.4 | — | |
| DiNAT-LResolution=384x384, Params=200 M, FLOPs=89.7 G, Throughput=161 imgs/sec, Peak Memory=20.1 GB, Pre-training=ImageNet-22K2022.09 | 87.4 | — | |
| DINAT-LWin. Size=7^2, # of Params=200 M, FLOPs=89.7 G, Thru. (imgs/sec)=161, Memory (GB)=20.1, Resolution=384x384, Batch size=256, Hardware=NVIDIA A1002022.09 | 87.4 | — | |
| dBOTBackbone=ViT-H, Resolution=224, Evaluation Protocol=Fine-tuned2022.09 | 87.4 | — | |
| EffNetV2-XLFamily=C, Input Size=512, #FLOPs (G)=94, #Params (M)=208, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87.3 | — | |
| Swin-LFamily=T, Input Size=384, #FLOPs (G)=103.9, #Params (M)=197, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87.3 | — | |
| CoAtNet-2Family=H, Input Size=512, #FLOPs (G)=96.7, #Params (M)=75, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87.3 | — | |
| EffNetV2-XLEval size=512, Params=208M, FLOPs=94.0G, Pre-training=ImageNet-21K2022.04 | 87.3 | — | |
| Swin-LEval size=384, Params=197M, FLOPs=103.9G, Pre-training=ImageNet-21K2022.04 | 87.3 | — | |
| CoAtNet-2Eval size=512, Params=75M, FLOPs=96.7G, Pre-training=ImageNet-21K2022.04 | 87.3 | — | |
| Swin-L (384 resolution)Image Size=384x384, Params (M)=197, FLOPs (G)=103.9, Pre-training=ImageNet-22K, Fine-tuning=384x384 for 30 epochs2022.07 | 87.3 | — | |
| Swin-L#Params=197 M, Test size=384, Pre-training/Method=Supervised, Fine-tuned on ImageNet-22K=true2022.02 | 87.3 | — | |
| EfficientNetV2-XLeval size=480x480, params=208M, FLOPS=94B, pre-training=ImageNet-22K pretraining2022.10 | 87.3 | — | |
| Swin-Leval size=384x384, params=197M, FLOPS=103.9B, pre-training=ImageNet-22K pretraining2022.10 | 87.3 | — | |
| Swin-LImage Size=384x384, Params (M)=197, FLOPs (G)=103.9, Pre-training Dataset=ImageNet-22K2022.12 | 87.3 | — | |
| Swin-LResolution=384x384, Params=197 M, FLOPs=104.0 G, Throughput=169 imgs/sec, Peak Memory=32.7 GB, Pre-training=ImageNet-22K, Window size=12x122022.09 | 87.3 | — | |
| Swin-LWin. Size=12^2, # of Params=197 M, FLOPs=104.0 G, Thru. (imgs/sec)=169, Memory (GB)=32.7, Resolution=384x384, Batch size=256, Hardware=NVIDIA A1002022.09 | 87.3 | — | |
| MOAT-1eval size=512x512, params=41.6M, FLOPS=58.7B, pre-training=ImageNet-22K pretraining2022.10 | 87.2 | — | |
| MSG-MAELoss Function=MSG-GAN-P, Pre-training Data=IN1K, Backbone=ViT-L, Evaluation Protocol=Fine-tuning2022.12 | 87.2 | — | |
| ResNet+ViT-L/16Eval size=384, Params=330M, Pre-training=JFT2022.04 | 87.12 | — | |
| CoAtNet-2Family=H, Input Size=384, #FLOPs (G)=49.8, #Params (M)=75, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87.1 | — | |
| WISE-FT CLIPBackbone=ViT-L, Resolution=336x336, Feature Distillation=false, Evaluation Protocol=fine-tuning2022.05 | 87.1 | — | |
| SwinV2-BEval size=384, Params=88M, Pre-training=ImageNet-21K2022.04 | 87.1 | — | |
| CoAtNet-2Eval size=384, Params=75M, FLOPs=49.8G, Pre-training=ImageNet-21K2022.04 | 87.1 | — | |
| FAN-L-HybridParams (M)=76.8, Pre-trained=ImageNet-22K, Resolution=384x3842022.04 | 87.1 | — | |
| SwinV2-H#Params=658 M, Test size=512, Pre-training/Method=SimMIM2022.02 | 87.1 | — | |
| VOLO-D5Params=269M, Train Res=224, Eval Res=512, MACS=412B, Reference=Yuan et al., 20212022.06 | 87.1 | — | |
| UniNet-B5Family=H, Input Size=384, #FLOPs (G)=20.4, #Params (M)=72.9, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.07 | 87 | — | |
| CSwin-BEval size=384, Params=78M, FLOPs=47.0G, Pre-training=ImageNet-21K2022.04 | 87 | — | |
| HorNet-LGFImage Size=224x224, Params (M)=196, FLOPs (G)=34.6, Pre-training=ImageNet-22K2022.07 | 87 | — |