Image Classification on 11 Fine-Grained Datasets Average
9.2Mean Top-1 ErrorInCA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InCAArchitecture=ViT-L/16, Resolution=@384, Pre-training data=In21K (DeiT), Model size=304.7M2023.03 | 9.2 | -0.61 | |
| InCAArchitecture=CLIP-ViT-L/14, Resolution=@336, Pre-training data=400M Im-Text, Model size=304.2M2023.03 | 9.2 | — | |
| Full FTArchitecture=SWIN-L, Pre-training data=In21K, Model size=196.5M2023.03 | 9.3 | 0 | |
| InCAArchitecture=ViT-H/14, Pre-training data=2B Im-Text, Model size=632.8M2023.03 | 9.4 | — | |
| Full FTArchitecture=ConvNext-B, Pre-training data=In21K, Model size=88.5M2023.03 | 9.4 | 0 | |
| InCAArchitecture=ViT-G/14, Pre-training data=2B Im-Text, Model size=1884.9M2023.03 | 9.6 | — | |
| InCAArchitecture=ViT-L/16, Pre-training data=In21K (DeiT), Model size=304.3M2023.03 | 9.8 | -2.3 | |
| Full FTArchitecture=ViT-L/16, Pre-training data=In21K (DeiT), Model size=304.3M2023.03 | 10 | 0 | |
| InCAArchitecture=SWIN-L, Pre-training data=In21K, Model size=196.5M2023.03 | 10 | -3.6 | |
| InCA (last)Architecture=ViT-H/14, Pre-training data=2B Im-Text, Model size=632.8M, backbone_backprop=false2023.03 | 10.4 | — | |
| InCA (last)Architecture=ViT-G/14, Pre-training data=2B Im-Text, Model size=1884.9M, backbone_backprop=false2023.03 | 10.4 | — | |
| InCA (last)Architecture=CLIP-ViT-L/14, Resolution=@336, Pre-training data=400M Im-Text, Model size=304.2M, backbone_backprop=false2023.03 | 10.6 | — | |
| InCAArchitecture=ConvNext-B, Pre-training data=In21K, Model size=88.5M2023.03 | 10.7 | -7.4 | |
| Full FTArchitecture=ResNext-101, Pre-training data=IG-3.5B, Model size=468.5M2023.03 | 11.4 | 0 | |
| InCA (last)Architecture=ViT-L/16, Pre-training data=In21K (DeiT), Model size=304.3M, backbone_backprop=false2023.03 | 11.5 | -7 | |
| InCA (last)Architecture=ViT-L/16, Resolution=@384, Pre-training data=In21K (DeiT), Model size=304.7M, backbone_backprop=false2023.03 | 11.7 | -9.11 | |
| InCAArchitecture=ResNext-101, Pre-training data=IG-3.5B, Model size=468.5M2023.03 | 12 | -8.7 | |
| InCA (last)Architecture=SWIN-L, Pre-training data=In21K, Model size=196.5M, backbone_backprop=false2023.03 | 12.4 | -9.5 | |
| InCA (last)Architecture=ConvNext-B, Pre-training data=In21K, Model size=88.5M, backbone_backprop=false2023.03 | 12.5 | -12.6 | |
| Full FTArchitecture=ViT-B/16, Pre-training data=In21K, Model size=86.5M2023.03 | 13 | 0 | |
| InCAArchitecture=ViT-B/16, Pre-training data=ALBEF (CC14M), Model size=85.9M2023.03 | 13.5 | -4.2 | |
| Full FTArchitecture=ViT-B/16, Pre-training data=ALBEF (CC14M), Model size=85.9M2023.03 | 13.8 | 0 | |
| inter. LPArchitecture=ViT-H/14, Pre-training data=2B Im-Text, Model size=632.8M2023.03 | 14 | — | |
| InCA (last)Architecture=ViT-B/16, Pre-training data=ALBEF (CC14M), Model size=85.9M, backbone_backprop=false2023.03 | 14.8 | -9.3 | |
| LPArchitecture=ViT-H/14, Pre-training data=2B Im-Text, Model size=632.8M2023.03 | 15.2 | — | |
| inter. LPArchitecture=ViT-G/14, Pre-training data=2B Im-Text, Model size=1884.9M2023.03 | 15.3 | — | |
| inter. LPArchitecture=SWIN-L, Pre-training data=In21K, Model size=196.5M2023.03 | 15.8 | -31.3 | |
| InCAArchitecture=ViT-B/16, Pre-training data=In21K, Model size=86.5M2023.03 | 15.9 | -7.6 | |
| LPArchitecture=ViT-G/14, Pre-training data=2B Im-Text, Model size=1884.9M2023.03 | 16.8 | — | |
| inter. LPArchitecture=ViT-L/16, Pre-training data=In21K (DeiT), Model size=304.3M2023.03 | 17.2 | -35.7 | |
| inter. LPArchitecture=ViT-L/16, Resolution=@384, Pre-training data=In21K (DeiT), Model size=304.7M2023.03 | 17.3 | -38.1 | |
| InCA (last)Architecture=ResNext-101, Pre-training data=IG-3.5B, Model size=468.5M, backbone_backprop=false2023.03 | 17.3 | -27.1 | |
| InCA (last)Architecture=ViT-B/16, Pre-training data=In21K, Model size=86.5M, backbone_backprop=false2023.03 | 17.5 | -16.4 | |
| LPArchitecture=SWIN-L, Pre-training data=In21K, Model size=196.5M2023.03 | 18.3 | -40.5 | |
| inter. LPArchitecture=ConvNext-B, Pre-training data=In21K, Model size=88.5M2023.03 | 19.1 | -44.2 | |
| LPArchitecture=ConvNext-B, Pre-training data=In21K, Model size=88.5M2023.03 | 19.4 | -44.2 | |
| inter. LPArchitecture=CLIP-ViT-L/14, Resolution=@336, Pre-training data=400M Im-Text, Model size=304.2M2023.03 | 19.6 | — | |
| inter. LPArchitecture=ResNext-101, Pre-training data=IG-3.5B, Model size=468.5M2023.03 | 20.1 | -38.8 | |
| LPArchitecture=ResNext-101, Pre-training data=IG-3.5B, Model size=468.5M2023.03 | 21.3 | -39.7 | |
| LPArchitecture=CLIP-ViT-L/14, Resolution=@336, Pre-training data=400M Im-Text, Model size=304.2M2023.03 | 21.8 | — | |
| LPArchitecture=ViT-L/16, Pre-training data=In21K (DeiT), Model size=304.3M2023.03 | 21.9 | -52.5 | |
| LPArchitecture=ViT-L/16, Resolution=@384, Pre-training data=In21K (DeiT), Model size=304.7M2023.03 | 22 | -54.4 | |
| inter. LPArchitecture=ViT-B/16, Pre-training data=In21K, Model size=86.5M2023.03 | 23.9 | -32.4 | |
| LPArchitecture=ViT-B/16, Pre-training data=In21K, Model size=86.5M2023.03 | 24.3 | -32.4 | |
| inter. LPArchitecture=ViT-B/16, Pre-training data=ALBEF (CC14M), Model size=85.9M2023.03 | 24.7 | -42.6 | |
| LPArchitecture=ViT-B/16, Pre-training data=ALBEF (CC14M), Model size=85.9M2023.03 | 25.8 | -42.6 |