Image Classification on VTAB-1K 1.0 (test)
86Natural AccuracyBiT-L R152x4
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BiT-L R152x4Pre-training=JFT, Backbone=ResNet-152x42020.10 | 86 | — | — | — | — | 76.2 | 87 | 62.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLoRABackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.152025.12 | 84.7 | — | — | — | — | 75.3 | 86.6 | 61.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLRRBackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.822025.12 | 83.9 | — | — | — | — | 75.2 | 86.4 | 61.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R101 ExpertsPre-training=JFT, Backbone=ResNet-101, Diversity=Upstream2020.10 | 83.6 | — | — | — | — | 77.6 | 86.4 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA+AOFTBackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.152025.12 | 83.3 | — | — | — | — | 74.3 | 85.9 | 60.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HSTTrainable Parameters (M)=0.782024.02 | 82.8 | — | — | — | — | 78.1 | 87.1 | 64.5 | — | — | — | — | — | — | 94.1 | 76.7 | 74.8 | 99.6 | 91.1 | 52.3 | 91.2 | 87.1 | 96.3 | 88.6 | 76.5 | 85.4 | 63.7 | 52.9 | 87.2 | 56.8 | 81.7 | 35.8 | 52.1 | |
| LoSA, r = 16Trainable Parameters (M)=0.192024.02 | 82.8 | — | — | — | — | 78.4 | 86.9 | 65.5 | — | — | — | — | — | — | 92.8 | 82.5 | 76.1 | 99.7 | 90.5 | 55.8 | 82 | 86.6 | 97.1 | 87 | 76.7 | 81.5 | 62.3 | 48.6 | 94.2 | 61.7 | 82.1 | 47.9 | 45.6 | |
| R50 Experts + GeneralistsPre-training=JFT, Backbone=ResNet-50, Diversity=Upstream2020.10 | 82.6 | — | — | — | — | 76.8 | 85.8 | 67.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptFormerBackbone=CLIP2022.12 | 82.6 | — | — | — | — | — | 85.1 | 60.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoSA, r = 8Trainable Parameters (M)=0.12024.02 | 82.6 | — | — | — | — | 78.3 | 87 | 65.3 | — | — | — | — | — | — | 92.7 | 82.2 | 76.7 | 99.7 | 90.7 | 55.4 | 81 | 86.9 | 97.1 | 87.4 | 76.5 | 79.9 | 61.8 | 48.6 | 92.3 | 61.1 | 82.4 | 48.7 | 47.3 | |
| LoSA, r = 4Trainable Parameters (M)=0.052024.02 | 82.5 | — | — | — | — | 77.8 | 86.5 | 64.4 | — | — | — | — | — | — | 93 | 82.7 | 76.2 | 99.7 | 89.8 | 56.1 | 80 | 86.3 | 96.7 | 86.7 | 76.3 | 78.8 | 61.4 | 48 | 91.7 | 58.4 | 82.6 | 46.9 | 47.6 | |
| VPTBackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.492025.12 | 82.5 | — | — | — | — | 70.8 | 83.9 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RSTrainable Parameters (M)=0.552024.02 | 82.3 | — | — | — | — | 76.3 | 85.5 | 61.2 | — | — | — | — | — | — | 92.7 | 75.2 | 71.9 | 99.3 | 91.9 | 58.5 | 86.7 | 86.7 | 95.6 | 85 | 74.6 | 80.2 | 63.6 | 50.6 | 85.4 | 55.7 | 80.2 | 31.9 | 42 | |
| ARCBackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.182025.12 | 82.3 | — | — | — | — | 72.5 | 85.6 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptFormer+VQTBackbone=CLIP2022.12 | 82.1 | — | — | — | — | — | 85.8 | 62.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConvpassTrainable Parameters (M)=0.332024.02 | 81.7 | — | — | — | — | 76.6 | 85.3 | 62.7 | — | — | — | — | — | — | 91.2 | 72.3 | 72.2 | 99.2 | 90.9 | 54.9 | 91.3 | 84.2 | 96.1 | 85.3 | 75.6 | 82.3 | 67.9 | 51.3 | 85.9 | 53.1 | 80 | 36.4 | 44.4 | |
| VPT+VQTBackbone=CLIP2022.12 | 81.5 | — | — | — | — | — | 86.3 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLoRABackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=0.192025.12 | 80.7 | — | — | — | — | 72.3 | 85.6 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptFormerTrainable Parameters (M)=0.162024.02 | 80.6 | — | — | — | — | 74.7 | 84.9 | 58.8 | — | — | — | — | — | — | 91.2 | 70.8 | 70.5 | 99.1 | 90.9 | 54.8 | 86.6 | 83 | 95.8 | 84.4 | 76.3 | 81.9 | 64.3 | 49.3 | 76.3 | 45.7 | 80.3 | 31.7 | 41.1 | |
| FacT-TKTrainable Parameters (M)=0.062024.02 | 80.6 | — | — | — | — | 75.6 | 85.3 | 60.7 | — | — | — | — | — | — | 90.6 | 70.6 | 70.8 | 99.1 | 90.7 | 54.1 | 88.6 | 84.8 | 96.2 | 84.5 | 75.7 | 82.6 | 68.2 | 49.8 | 80.8 | 47.4 | 80.7 | 33.2 | 43 | |
| VPTBackbone=CLIP2022.12 | 80.4 | — | — | — | — | — | 84.9 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiT-M R101x3Pre-training=ImageNet-21k, Backbone=ResNet-101x32020.10 | 80.3 | — | — | — | — | 72.7 | 85.7 | 59.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NOAHTrainable Parameters (M)=0.362024.02 | 80.3 | — | — | — | — | 75.5 | 84.9 | 61.3 | — | — | — | — | — | — | 92.7 | 69.6 | 70.2 | 99.1 | 90.4 | 53.7 | 86.1 | 84.4 | 95.4 | 83.9 | 75.8 | 82.8 | 68.9 | 49.9 | 81.8 | 48.3 | 81.7 | 32.8 | 44.2 | |
| AdaptFormerBackbone=Supervised ImageNet-21K2022.12 | 80.1 | — | — | — | — | — | 82.3 | 50.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R50 ExpertsPre-training=ImageNet-21k, Backbone=ResNet-50, Diversity=Upstream2020.10 | 79.9 | — | — | — | — | 75.3 | 85.7 | 66.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R50 HyperExpertsPre-training=ImageNet-21k, Backbone=ResNet-50, Diversity=Combined2020.10 | 79.9 | — | — | — | — | 75.6 | 85.5 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-SHALLOWBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=1.01x2022.03 | 79.85 | — | — | — | — | — | 82.45 | 37.75 | — | — | — | — | — | 6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptFormer+VQTBackbone=Supervised ImageNet-21K2022.12 | 79.6 | — | — | — | — | — | 84.3 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LORATrainable Parameters (M)=0.292024.02 | 79.5 | — | — | — | — | 74.5 | 84.6 | 59.8 | — | — | — | — | — | — | 91.4 | 67.1 | 69.4 | 98.8 | 90.4 | 54 | 85.3 | 84.9 | 95.3 | 84.4 | 73.6 | 82.9 | 69.2 | 49.8 | 75.7 | 47.1 | 78.5 | 31 | 44 | |
| RLRRBackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=1.332025.12 | 79.4 | — | — | — | — | 72 | 85.1 | 59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FULLBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=19.01x2022.03 | 79.1 | — | — | — | — | — | 86.21 | 59.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPTBackbone=Supervised ImageNet-21K2022.12 | 79.1 | — | — | — | — | — | 84.6 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARCBackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=0.222025.12 | 79.1 | — | — | — | — | 69.9 | 84.8 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdapterTrainable Parameters (M)=0.162024.02 | 79 | — | — | — | — | 73.9 | 84.1 | 58.5 | — | — | — | — | — | — | 90.1 | 69.2 | 68 | 98.8 | 89.9 | 54.3 | 82.8 | 84 | 94.9 | 81.9 | 75.5 | 80.9 | 65.3 | 48.6 | 74.8 | 48.5 | 78.3 | 29.9 | 41.6 | |
| VPT+VQTBackbone=Supervised ImageNet-21K2022.12 | 78.9 | — | — | — | — | — | 83.7 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA+AOFTBackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=0.202025.12 | 78.8 | — | — | — | — | 71.3 | 83.8 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPTTrainable Parameters (M)=0.532024.02 | 78.5 | — | — | — | — | 72 | 82.4 | 55 | — | — | — | — | — | — | 90.8 | 78.8 | 65.8 | 98 | 88.3 | 49.6 | 78.1 | 81.8 | 96.1 | 83.4 | 68.4 | 68.5 | 60 | 46.5 | 73.6 | 47.9 | 72.8 | 32.9 | 37.8 | |
| Visual-Prompt TuningBackbone=ConvNeXt-Base, Total params=1.02x2022.03 | 78.48 | — | — | — | — | — | 83 | 44.64 | — | — | 6 | 1 | 1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FULLBackbone=ConvNeXt-Base, Total params=19.01x2022.03 | 77.97 | — | — | — | — | — | 83.71 | 60.41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPTBackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=0.962025.12 | 77.9 | — | — | — | — | 68.2 | 83.3 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiT-L R50Pre-training=JFT, Backbone=ResNet-502020.10 | 77.8 | — | — | — | — | 70.6 | 83.6 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRABackbone=ViT-Huge, Tuning Protocol=Parameter-efficient tuning, #Param.(M)=1.212025.12 | 77.1 | — | — | — | — | 69.3 | 83.5 | 55.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiT-M R50Pre-training=ImageNet-21k, Backbone=ResNet-502020.10 | 77 | — | — | — | — | 70 | 84.7 | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SNELL-8Backbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based, Rank=82024.11 | 76.8 | 75.5 | — | — | — | — | 86 | 63.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DEEPBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=1.05x2022.03 | 76.78 | — | — | — | — | — | 84.53 | 53.35 | — | — | — | — | — | 6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RS-BypassTrainable Parameters (M)=0.422024.02 | 76.7 | — | — | — | — | 72.3 | 84.6 | 55.7 | — | — | — | — | — | — | 88.8 | 64.5 | 73.2 | 99.4 | 90.6 | 57.2 | 63.5 | 85.5 | 95.2 | 82.4 | 75.2 | 70.4 | 61 | 40.2 | 79.2 | 52.6 | 66.8 | 26 | 49.3 | |
| SPT-AdapterBackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Additional-based2024.11 | 76.6 | 74.4 | — | — | — | — | 85 | 61.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPT-LoRABackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based2024.11 | 76.5 | 75.3 | — | — | — | — | 86 | 63.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullTrainable Parameters (M)=85.82024.02 | 75.9 | — | — | — | — | 68.9 | 83.4 | 47.6 | — | — | — | — | — | — | 87.7 | 68.9 | 64.3 | 97.2 | 86.9 | 38.8 | 87.4 | 79.7 | 95.7 | 84.2 | 73.9 | 56.3 | 58.6 | 41.7 | 57.5 | 46.7 | 65.5 | 25.7 | 29.1 | |
| FullBackbone=ViT-Large, Tuning Category=Traditional fine-tuning, #Param.(M)=303.402025.12 | 74.7 | — | — | — | — | 65.4 | 83.8 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LINEARBackbone=ConvNeXt-Base, Total params=1.01x2022.03 | 74.48 | — | — | — | — | — | 81.5 | 34.76 | — | — | 5 | 0 | 1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adapter-32Backbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Additional-based, Bottleneck dimension=322024.11 | 74.2 | 68.2 | — | — | — | — | 82.7 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BIASBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=1.06x2022.03 | 74.19 | — | — | — | — | — | 80.14 | 42.42 | — | — | — | — | — | 2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MLP-3Backbone=ConvNeXt-Base, Total params=1.47x2022.03 | 73.78 | — | — | — | — | — | 81.36 | 35.68 | — | — | 5 | 1 | 1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PARTIAL-1Backbone=ConvNeXt-Base, Total params=2.84x2022.03 | 73.76 | — | — | — | — | — | 81.64 | 39.55 | — | — | 4 | 0 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MLP-3Backbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=1.47x2022.03 | 73.56 | — | — | — | — | — | 75.21 | 35.69 | — | — | — | — | — | 5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LINEARBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=1.01x2022.03 | 73.52 | — | — | — | — | — | 80.77 | 33.52 | — | — | — | — | — | 5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BitFitTrainable Parameters (M)=0.12024.02 | 73.3 | — | — | — | — | 65.2 | 78.3 | 44.1 | — | — | — | — | — | — | 87 | 72.8 | 59.2 | 97.5 | 85.3 | 51.4 | 59.9 | 78.7 | 91.6 | 72.9 | 69.8 | 61.5 | 55.6 | 32.4 | 66.6 | 40 | 55.9 | 15.7 | 25.1 | |
| PARTIALBackbone=Swin-B, Pre-training=ImageNet-21k, Total parameters multiplier=3.77x2022.03 | 73.11 | — | — | — | — | — | 81.7 | 34.96 | — | — | — | — | — | 4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiasBackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based2024.11 | 72.9 | 69.2 | — | — | — | — | 81.1 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VQTBackbone=ViT-B/16, Pre-training=ImageNet-1K2022.12 | 72.7 | — | — | — | — | 65.3 | 84.5 | 49.3 | — | — | — | — | — | — | 89.4 | 58.4 | 66.7 | 90.4 | 89.1 | 33.7 | 81.1 | 82.2 | 96.2 | 84.7 | 74.9 | 50.8 | 57.6 | 43.5 | 65.9 | 43.1 | 77.2 | 24.8 | 31.6 | |
| Partial-1Backbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based2024.11 | 72.3 | 68.3 | — | — | — | — | 84.6 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullBackbone=ViT-B/16, Pre-training strategy=MoCo v32024.11 | 72 | 69.6 | — | — | — | — | 84.7 | 42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptFormer+VQTBackbone=MAE2022.12 | 71.1 | — | — | — | — | — | 83.3 | 59.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinearBackbone=ViT-Large, Tuning Category=Traditional fine-tuning, #Param.(M)=0.052025.12 | 70.9 | — | — | — | — | 51.5 | 69.1 | 25.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullBackbone=ViT-Huge, Tuning Protocol=Traditional fine-tuning, #Param.(M)=630.902025.12 | 70.9 | — | — | — | — | 63.1 | 83.6 | 46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRABackbone=ViT-Large, Tuning Category=Parameter-efficient tuning, #Param.(M)=0.742025.12 | 70.5 | — | — | — | — | 72 | 85 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DeepBackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Additional-based2024.11 | 70.3 | 65.2 | — | — | — | — | 83 | 42.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinearTrainable Parameters (M)=02024.02 | 69.1 | — | — | — | — | 57.6 | 77.1 | 26.9 | — | — | — | — | — | — | 85 | 64.4 | 63.2 | 97 | 86.3 | 51 | 36.6 | 78.5 | 87.5 | 68.5 | 74 | 34.3 | 30.6 | 33.2 | 12.5 | 20 | 55.4 | 9.6 | 19.2 | |
| BIASBackbone=ConvNeXt-Base, Total params=1.04x2022.03 | 69.07 | — | — | — | — | — | 72.81 | 25.29 | — | — | 2 | 0 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HEAD2TOEBackbone=ViT-B/16, Pre-training=ImageNet-1K2022.12 | 68.9 | — | — | — | — | 62.3 | 82.9 | 46.3 | — | — | — | — | — | — | 86.8 | 54.4 | 64.1 | 83.4 | 82.6 | 32.1 | 78.9 | 81.3 | 95.4 | 81.2 | 73.7 | 49 | 57.7 | 41.5 | 52.3 | 32.8 | 64.4 | 32.7 | 39.7 | |
| AdaptFormerBackbone=MAE2022.12 | 68.7 | — | — | — | — | — | 81.3 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SNELL-8Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based, Rank=82024.11 | 68.3 | 71.8 | — | — | — | — | 83.8 | 63.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT+VQTBackbone=MAE2022.12 | 67.9 | — | — | — | — | — | 82.7 | 49.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinearBackbone=ViT-Huge, Tuning Protocol=Traditional fine-tuning, #Param.(M)=0.062025.12 | 67.9 | — | — | — | — | 52.7 | 79 | 26.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinearBackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based2024.11 | 67.5 | 59.6 | — | — | — | — | 81.1 | 30.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-ShallowBackbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Additional-based2024.11 | 67.3 | 62.4 | — | — | — | — | 82.3 | 37.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Visual-Prompt TuningBackbone=ResNet-50, Total params=1.09x2022.03 | 66.25 | — | — | — | — | — | 77.32 | 37.52 | — | — | 6 | 2 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPT-AdapterBackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Additional-based2024.11 | 65.6 | 69.7 | — | — | — | — | 82.7 | 60.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPT-LoRABackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based2024.11 | 65.4 | 69.8 | — | — | — | — | 82.4 | 61.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fine-tuningBackbone=ViT-B/16, Pre-training=ImageNet-1K2022.12 | 65.2 | — | — | — | — | 63.2 | 81.7 | 52.2 | — | — | — | — | — | — | 84.5 | 44.3 | 54.1 | 84.7 | 74.7 | 26.9 | 87.2 | 85.3 | 95 | 76 | 70.4 | 71.5 | 60.5 | 46.9 | 74.5 | 38.7 | 72.9 | 28.5 | 23.8 | |
| PARTIAL-1Backbone=ResNet-50, Total params=4.69x2022.03 | 64.34 | — | — | — | — | — | 78.64 | 45.78 | — | — | 6 | 2 | 1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LINEARBackbone=ResNet-50, Total params=1.08x2022.03 | 63.75 | — | — | — | — | — | 77.6 | 30.96 | — | — | 6 | 3 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BIASBackbone=ResNet-50, Total params=1.10x2022.03 | 63.51 | — | — | — | — | — | 77.22 | 33.39 | — | — | 6 | 2 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPTBackbone=MAE2022.12 | 63.5 | — | — | — | — | — | 79.1 | 48.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear-probingBackbone=ViT-B/16, Pre-training=ImageNet-1K2022.12 | 63.2 | — | — | — | — | 52.7 | 77.1 | 31.4 | — | — | — | — | — | — | 85.6 | 50.6 | 61.4 | 79.5 | 86.5 | 38 | 40.8 | 79.7 | 91.5 | 71.7 | 65.5 | 41.4 | 34.4 | 34.1 | 18.1 | 26.4 | 55.4 | 16.5 | 24.8 | |
| MLP-3Backbone=ResNet-50, Total params=7.87x2022.03 | 61.79 | — | — | — | — | — | 70.77 | 33.97 | — | — | 6 | 1 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FULLBackbone=ResNet-50, Total params=19.08x2022.03 | 59.72 | — | — | — | — | — | 76.66 | 54.08 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullBackbone=ViT-B/16, Pre-training strategy=MAE2024.11 | 59.3 | 64.3 | — | — | — | — | 79.7 | 53.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Partial-1Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based2024.11 | 58.4 | 61.5 | — | — | — | — | 78.3 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-8Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based, Rank=82024.11 | 57.5 | 64.3 | — | — | — | — | 77.7 | 57.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-16Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based, Rank=162024.11 | 57.3 | 64.8 | — | — | — | — | 77.1 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adapter-8Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Additional-based, Bottleneck dimension=82024.11 | 57.2 | 63.4 | — | — | — | — | 78.4 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adapter-32Backbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Additional-based, Bottleneck dimension=322024.11 | 55.3 | 62.5 | — | — | — | — | 78.8 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiasBackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based2024.11 | 54.6 | 59.3 | — | — | — | — | 75.7 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-ShallowBackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Additional-based2024.11 | 40 | 45.7 | — | — | — | — | 69.7 | 27.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DeepBackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Additional-based2024.11 | 36 | 41.1 | — | — | — | — | 60.6 | 26.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adapter-8Backbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Additional-based, Bottleneck dimension=82024.11 | 27.6 | 49 | — | — | — | — | 70.9 | 48.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-8Backbone=ViT-B/16, Pre-training strategy=MoCo v3, Method Category=Reparameterization-based, Rank=82024.11 | 21.2 | 44.3 | — | — | — | — | 66.7 | 45.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LinearBackbone=ViT-B/16, Pre-training strategy=MAE, Method Category=Reparameterization-based2024.11 | 18.9 | 32.1 | — | — | — | — | 52.7 | 23.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |