Image Classification on ImageNet-1K (val) (Top-1 Accuracy and MACs)
88.1Top-1 AccCAFormer-B36
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CAFormer-B36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=99, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 88.1 | 72.2 | |
| ConvFormer-B36MetaFormer=true, Mixing Type=Conv, Params (M)=100, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87.6 | 66.5 | |
| CAFormer-M36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=56, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87.5 | 42 | |
| ConvNeXt-LMetaFormer=false, Mixing Type=Conv, Params (M)=198, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87.5 | 101 | |
| CAFormer-B36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=99, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87.4 | 23.2 | |
| Swin-LMetaFormer=false, Mixing Type=Attn, Params (M)=197, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87.3 | 103.9 | |
| ConvFormer-B36MetaFormer=true, Mixing Type=Conv, Params (M)=100, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 87 | 22.6 | |
| CAFormer-S36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=39, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.9 | 26 | |
| ConvFormer-M36MetaFormer=true, Mixing Type=Conv, Params (M)=57, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.9 | 37.7 | |
| ConvNeXt-BMetaFormer=false, Mixing Type=Conv, Params (M)=89, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.8 | 45.1 | |
| ConvNeXt-LMetaFormer=false, Mixing Type=Conv, Params (M)=198, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.8 | 34.4 | |
| CAFormer-M36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=56, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.6 | 13.2 | |
| ConvFormer-S36MetaFormer=true, Mixing Type=Conv, Params (M)=40, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.4 | 22.4 | |
| Swin-BMetaFormer=false, Mixing Type=Attn, Params (M)=88, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.4 | 47.1 | |
| Swin-LMetaFormer=false, Mixing Type=Attn, Params (M)=197, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.3 | 34.5 | |
| ConvFormer-M36MetaFormer=true, Mixing Type=Conv, Params (M)=57, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 86.1 | 12.8 | |
| ConvNeXt-SMetaFormer=false, Mixing Type=Conv, Params (M)=50, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.8 | 25.5 | |
| CAFormer-S36MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=39, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.8 | 8 | |
| ConvNeXt-BMetaFormer=false, Mixing Type=Conv, Params (M)=89, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.8 | 15.4 | |
| CAFormer-S18MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=26, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.4 | 13.4 | |
| ConvFormer-S36MetaFormer=true, Mixing Type=Conv, Params (M)=40, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.4 | 7.6 | |
| Swin-BMetaFormer=false, Mixing Type=Attn, Params (M)=88, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85.2 | 15.4 | |
| ConvFormer-S18MetaFormer=true, Mixing Type=Conv, Params (M)=27, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 85 | 11.6 | |
| ConvNeXt-SMetaFormer=false, Mixing Type=Conv, Params (M)=50, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 84.6 | 8.7 | |
| ConvNeXt-TMetaFormer=false, Mixing Type=Conv, Params (M)=29, Resolution=384, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 84.1 | 13.1 | |
| CAFormer-S18MetaFormer=true, Mixing Type=Conv + Attn, Params (M)=26, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 84.1 | 4.1 | |
| ConvFormer-S18MetaFormer=true, Mixing Type=Conv, Params (M)=27, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 83.7 | 3.9 | |
| ConvNeXt-TMetaFormer=false, Mixing Type=Conv, Params (M)=29, Resolution=224, Pre-training=ImageNet-21K, Fine-tuning=ImageNet-1K2022.10 | 82.9 | 4.5 |