Image Classification on ImageNet-1K (test) (Standard Accuracy)
91Top-1 AccuracyCoCa
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCaVocabulary=Closed2022.05 | 91 | |
| FlorenceVocabulary=Closed2022.05 | 90.05 | |
| GIT2Vocabulary=Open2022.05 | 89.22 | |
| GITVocabulary=Open2022.05 | 88.79 | |
| ALIGNVocabulary=Closed2022.05 | 88.64 | |
| CoAtNet-4Eval Size=512x512, #Params=275M, #FLOPs=360.9B, Pre-training=ImageNet-21K, RandAugment=true, Pre-training Epochs=1502021.06 | 88.56 | |
| CoAtNet-4Eval Size=384x384, #Params=275M, #FLOPs=189.5B, Pre-training=ImageNet-21K, RandAugment=true, Pre-training Epochs=1502021.06 | 88.4 | |
| CoAtNet-4Eval Size=512x512, #Params=275M, #FLOPs=360.9B, Pre-training=ImageNet-21K, RandAugment=true2021.06 | 88.4 | |
| CoAtNet-4Eval Size=384x384, #Params=275M, #FLOPs=189.5B, Pre-training=ImageNet-21K, RandAugment=true2021.06 | 88.3 | |
| CoAtNet-4Eval Size=512x512, #Params=275M, #FLOPs=360.9B, Pre-training=ImageNet-21K2021.06 | 88.1 | |
| CLIP*Architecture=ViT-L/14, Resolution=336, Fine-tuning=true2023.06 | 88.1 | |
| CoAtNet-4Eval Size=384x384, #Params=275M, #FLOPs=189.5B, Pre-training=ImageNet-21K2021.06 | 87.9 | |
| CoAtNet-3Eval Size=512x512, #Params=168M, #FLOPs=203.1B, Pre-training=ImageNet-21K2021.06 | 87.9 | |
| SuperClassBackbone=ViT-L/16, Pretraining Data=Datacomp-1B2024.11 | 87.8 | |
| CvT-W24Eval Size=384x384, #Params=277M, #FLOPs=193.2B, Pre-training=ImageNet-21K2021.06 | 87.7 | |
| CapPaArchitecture=ViT-L/14, Resolution=336, Fine-tuning=true2023.06 | 87.7 | |
| CoAtNet-3Eval Size=384x384, #Params=168M, #FLOPs=107.4B, Pre-training=ImageNet-21K2021.06 | 87.6 | |
| OpenCLIPBackbone=ViT-L/14, Pretraining Data=Datacomp-1B2024.11 | 87.4 | |
| Swin-Limage size=384^2, #param.=197M, FLOPs=103.9G, throughput (image/s)=42.1, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 87.3 | |
| CoAtNet-2Eval Size=512x512, #Params=75M, #FLOPs=96.7B, Pre-training=ImageNet-21K2021.06 | 87.3 | |
| CoAtNet-2Eval Size=384x384, #Params=75M, #FLOPs=49.8B, Pre-training=ImageNet-21K2021.06 | 87.1 | |
| ENetV2-LEval Size=480x480, #Params=121M, #FLOPs=53B, Pre-training=ImageNet-21K2021.06 | 86.8 | |
| LARSBatch-size=40962026.03 | 86.77 | |
| CatLIPBackbone=ViT-L/16, Pretraining Data=Datacomp-1B2024.11 | 86.5 | |
| Swin-Bimage size=384^2, #param.=88M, FLOPs=47.0G, throughput (image/s)=84.7, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 86.4 | |
| Swin-LEval Size=384x384, #Params=197M, #FLOPs=103.9B, Pre-training=ImageNet-21K2021.06 | 86.4 | |
| CaiT-M36Arch=Trans, #Param (M)=271, FLOPs (G)=247.8, Train Size=224x224, Test Size=448x448, Knowledge Distillation=RegNet-16GF [74]2022.01 | 86.3 | |
| VOLO-D3Arch=CNN+Trans, #Param (M)=86, FLOPs (G)=67.9, Train Size=224x224, Test Size=448x4482022.01 | 86.3 | |
| UniFormer-LArch=CNN+Trans, #Param (M)=100, FLOPs (G)=39.2, Train Size=224x224, Test Size=384x384, Token Labeling=true2022.01 | 86.3 | |
| ENetV2-MEval Size=480x480, #Params=55M, #FLOPs=24B, Pre-training=ImageNet-21K2021.06 | 86.1 | |
| UniFormer-BArch=CNN+Trans, #Param (M)=50, FLOPs (G)=27.2, Train Size=224x224, Test Size=384x384, Token Labeling=true2022.01 | 86 | |
| Swin-BEval Size=384x384, #Params=88M, #FLOPs=47.0B, Pre-training=ImageNet-21K2021.06 | 86 | |
| CLIP*Architecture=ViT-B/16, Resolution=384, Fine-tuning=true2023.06 | 86 | |
| NFNet-F4Arch=CNN, #Param (M)=316, FLOPs (G)=215.3, Train Size=384x384, Test Size=512x5122022.01 | 85.9 | |
| LV-ViT-LArch=CNN+Trans, #Param (M)=150, FLOPs (G)=157.2, Train Size=288x288, Test Size=448x4482022.01 | 85.9 | |
| CoAtNet-3Arch=CNN+Trans, #Param (M)=168, FLOPs (G)=107.4, Train Size=224x224, Test Size=384x3842022.01 | 85.8 | |
| HaloNet-H4Eval Size=512x512, #Params=85M, Pre-training=ImageNet-21K2021.06 | 85.8 | |
| HaloNet-Conv-H4Eval Size=512x512, #Params=87M, Pre-training=ImageNet-21K2021.06 | 85.8 | |
| RAVLT-LYear='24, Params (M)=95, FLOPs (G)=16.0, Attention Type=Linear / sub-quadratic attention2026.02 | 85.8 | |
| EfficientNetV2-LArch=CNN, #Param (M)=121, FLOPs (G)=53, Train Size=480x480, Test Size=480x4802022.01 | 85.7 | |
| CapPaArchitecture=ViT-B/16, Resolution=384, Fine-tuning=true2023.06 | 85.7 | |
| UniFormer-LArch=CNN+Trans, #Param (M)=100, FLOPs (G)=12.6, Train Size=224x224, Test Size=224x224, Token Labeling=true2022.01 | 85.6 | |
| HaloNet-H4Eval Size=384x384, #Params=85M, Pre-training=ImageNet-21K2021.06 | 85.6 | |
| HaloNet-Conv-H4Eval Size=384x384, #Params=87M, Pre-training=ImageNet-21K2021.06 | 85.5 | |
| RMT-LYear='24, Params (M)=95, FLOPs (G)=18.2, Attention Type=Softmax / standard attention2026.02 | 85.5 | |
| LV-ViT-MArch=CNN+Trans, #Param (M)=56, FLOPs (G)=42.2, Train Size=224x224, Test Size=384x3842022.01 | 85.4 | |
| CSwin-BArch=Trans, #Param (M)=78, FLOPs (G)=47, Train Size=224x224, Test Size=384x3842022.01 | 85.4 | |
| CaiT-S36Arch=Trans, #Param (M)=68, FLOPs (G)=48, Train Size=224x224, Test Size=384x384, Knowledge Distillation=RegNet-16GF [74]2022.01 | 85.4 | |
| VOLO-D3Arch=CNN+Trans, #Param (M)=86, FLOPs (G)=20.6, Train Size=224x224, Test Size=224x2242022.01 | 85.4 | |
| R-152x4image size=480^2, #param.=937M, FLOPs=840.5G, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 85.4 | |
| InfViT-Pure (24L)Year=Ours, Params (M)=331, Attention Type=Ours (InfSA-based)2026.02 | 85.4 | |
| LV-ViT-LArch=CNN+Trans, #Param (M)=150, FLOPs (G)=59, Train Size=288x288, Test Size=288x2882022.01 | 85.3 | |
| ViT-L/16Eval Size=384x384, #Params=304M, #FLOPs=190.7B, Pre-training=ImageNet-21K2021.06 | 85.3 | |
| CapArchitecture=ViT-B/16, Resolution=384, Fine-tuning=true2023.06 | 85.3 | |
| STViT-LYear='23, Params (M)=95, FLOPs (G)=15.6, Attention Type=Softmax / standard attention2026.02 | 85.3 | |
| MLLA-BYear='24, Params (M)=96, FLOPs (G)=16.2, Attention Type=Linear / sub-quadratic attention2026.02 | 85.3 | |
| MambaVision-L2Year='25, Params (M)=242, FLOPs (G)=37.5, Attention Type=SSM / convolution-based2026.02 | 85.3 | |
| TulaBatch-size=10242026.03 | 85.28 | |
| ViT-L/16image size=384^2, #param.=307M, FLOPs=190.7G, throughput (image/s)=27.3, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 85.2 | |
| Swin-Bimage size=224^2, #param.=88M, FLOPs=15.4G, throughput (image/s)=278.1, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 85.2 | |
| FAT-B5Year='23, Params (M)=88, FLOPs (G)=15.1, Attention Type=Softmax / standard attention2026.02 | 85.2 | |
| EfficientNetV2-MArch=CNN, #Param (M)=54, FLOPs (G)=25, Train Size=480x480, Test Size=480x4802022.01 | 85.1 | |
| CoAtNet-1Arch=CNN+Trans, #Param (M)=42, FLOPs (G)=27.4, Train Size=224x224, Test Size=384x3842022.01 | 85.1 | |
| UniFormer-BArch=CNN+Trans, #Param (M)=50, FLOPs (G)=8.3, Train Size=224x224, Test Size=224x224, Token Labeling=true2022.01 | 85.1 | |
| InfViT-Pure (4L)Year=Ours, Params (M)=57.7, FLOPs (G)=59.0, Attention Type=Ours (InfSA-based)2026.02 | 85.1 | |
| InfViT-Linear (24L)Year=Ours, Params (M)=305, Attention Type=Ours (InfSA-based)2026.02 | 85.1 | |
| LARSBatch-size=20482026.03 | 85.02 | |
| CSwin-SArch=Trans, #Param (M)=35, FLOPs (G)=22, Train Size=224x224, Test Size=384x3842022.01 | 85 | |
| ENetV2-SEval Size=384x384, #Params=24M, #FLOPs=8.8B, Pre-training=ImageNet-21K2021.06 | 85 | |
| GC-ViT-BYear='23, Params (M)=90, FLOPs (G)=14.8, Attention Type=Softmax / standard attention2026.02 | 85 | |
| MambaVision-LYear='25, Params (M)=228, FLOPs (G)=34.9, Attention Type=SSM / convolution-based2026.02 | 85 | |
| UniFormer-SArch=CNN+Trans, #Param (M)=24, FLOPs (G)=13.7, Train Size=224x224, Test Size=384x384, Overlapped patch embedding=true, Token Labeling=true2022.01 | 84.9 | |
| CvT-21Eval Size=384x384, #Params=32M, #FLOPs=25B, Pre-training=ImageNet-21K2021.06 | 84.9 | |
| CLIP*Architecture=ViT-B/16, Resolution=224, Fine-tuning=true2023.06 | 84.9 | |
| InternImage-BYear='23, Params (M)=97, FLOPs (G)=16.0, Attention Type=Softmax / standard attention2026.02 | 84.9 | |
| HyenaPixelYear='24, Params (M)=111, FLOPs (G)=25.3, Attention Type=SSM / convolution-based2026.02 | 84.9 | |
| SG-Former-BYear='23, Params (M)=78, FLOPs (G)=15.6, Attention Type=Softmax / standard attention2026.02 | 84.7 | |
| InfViT-Linear (4L)Year=Ours, Params (M)=53.5, FLOPs (G)=59.0, Attention Type=Ours (InfSA-based)2026.02 | 84.7 | |
| UniFormer-SArch=CNN+Trans, #Param (M)=22, FLOPs (G)=11.9, Train Size=224x224, Test Size=384x384, Token Labeling=true2022.01 | 84.6 | |
| ViT-B/16Eval Size=384x384, #Params=87M, #FLOPs=55.4B, Pre-training=ImageNet-21K2021.06 | 84.6 | |
| SMT-LYear='23, Params (M)=81, FLOPs (G)=17.7, Attention Type=Softmax / standard attention2026.02 | 84.6 | |
| TulaBatch-size=20482026.03 | 84.58 | |
| CoAtNet-3Arch=CNN+Trans, #Param (M)=168, FLOPs (G)=34.7, Train Size=224x224, Test Size=224x2242022.01 | 84.5 | |
| FLatten-C-BYear='23, Params (M)=75, FLOPs (G)=15.0, Attention Type=Linear / sub-quadratic attention2026.02 | 84.5 | |
| LV-ViT-SArch=CNN+Trans, #Param (M)=26, FLOPs (G)=22.2, Train Size=224x224, Test Size=384x3842022.01 | 84.4 | |
| R-101x3image size=384^2, #param.=388M, FLOPs=204.6G, Pre-training=ImageNet-22K, Fine-tuning=ImageNet-1K2021.03 | 84.4 | |
| CapPaArchitecture=ViT-B/16, Resolution=224, Fine-tuning=true2023.06 | 84.4 | |
| CSwin-TArch=Trans, #Param (M)=23, FLOPs (G)=14, Train Size=224x224, Test Size=384x3842022.01 | 84.3 | |
| EffcientNet-B7Arch=CNN, #Param (M)=66, FLOPs (G)=39.2, Train Size=600x600, Test Size=600x6002022.01 | 84.3 | |
| HorNet-BYear='22, Params (M)=88, FLOPs (G)=15.5, Attention Type=Softmax / standard attention2026.02 | 84.3 | |
| Swin-BArch=Trans, #Param (M)=88, FLOPs (G)=47, Train Size=224x224, Test Size=384x3842022.01 | 84.2 | |
| CSwin-BArch=Trans, #Param (M)=78, FLOPs (G)=15, Train Size=224x224, Test Size=224x2242022.01 | 84.2 | |
| BoTNet-T7Arch=CNN+Trans, #Param (M)=79, FLOPs (G)=19.3, Train Size=256x256, Test Size=256x2562022.01 | 84.2 | |
| MambaVision-BType=Hybrid, GFLOPs=15.0, Params(M)=97.7, Input resolution=224 x 2242026.01 | 84.2 | |
| BaselineBackbone=ConvNeXt-Large2026.02 | 84.14 | |
| LV-ViT-MArch=CNN+Trans, #Param (M)=56, FLOPs (G)=16, Train Size=224x224, Test Size=224x2242022.01 | 84.1 | |
| SoLA-BType=Hybrid, GFLOPs=14.96, Params(M)=88.26, Input resolution=224 x 2242026.01 | 84.1 | |
| Agent Attn-BYear='24, Params (M)=88, FLOPs (G)=15.4, Attention Type=Linear / sub-quadratic attention2026.02 | 84.1 | |
| GITLVocabulary=Open2022.05 | 84.05 | |
| vHeat-BImage size=224x224, #Param.=68M, FLOPs=11.2G, Test Throughput=661 img/s2024.05 | 84 |