Fine-grained Image Classification on Oxford Flowers (test)
99.7Top-1 AccuracyARC*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ARC*Backbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.25, AugReg=true2024.03 | 99.7 | — | |
| SSFBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.39, AugReg=true2024.03 | 99.6 | — | |
| RLRR*Backbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.47, AugReg=true2024.03 | 99.6 | — | |
| RLRRBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.47, AugReg=false2024.03 | 99.5 | — | |
| ARCBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.25, AugReg=false2024.03 | 99.3 | — | |
| LoRABackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.44, AugReg=false2024.03 | 99.2 | — | |
| VPT-DeepBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.85, AugReg=false2024.03 | 99 | — | |
| Full fine-tuningBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=85.98, AugReg=false2024.03 | 98.8 | — | |
| BiasBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.28, AugReg=false2024.03 | 98.8 | — | |
| AdapterBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.41, AugReg=false2024.03 | 98.5 | — | |
| VPT-ShallowBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.25, AugReg=false2024.03 | 98.4 | — | |
| Linear probingBackbone=ViT-B/16, Pre-training=ImageNet-21k, Params. (M)=0.18, AugReg=false2024.03 | 97.9 | — | |
| SPT-DeepBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K, Tuning Depth=Deep2024.02 | 96.1 | — | |
| SPT-ShallowBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K, Tuning Depth=Shallow2024.02 | 95.03 | — | |
| FullBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K, Tuning Depth=Full2024.02 | 94.52 | — | |
| VPT-DeepBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K, Tuning Depth=Deep2024.02 | 94.41 | — | |
| GateVPTBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K2024.02 | 93.71 | — | |
| SPT-DeepBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K, Tuning Depth=Deep2024.02 | 93.07 | — | |
| FullBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K, Tuning Depth=Full2024.02 | 91.71 | — | |
| VPT-ShallowBackbone=ViT-B, Pre-training Method=MoCo-v3, Pre-training Dataset=ImageNet-1K, Tuning Depth=Shallow2024.02 | 90.47 | — | |
| SPT-ShallowBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K, Tuning Depth=Shallow2024.02 | 89.47 | — | |
| VPT-DeepBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K, Tuning Depth=Deep2024.02 | 80.05 | — | |
| GateVPTBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K2024.02 | 78.55 | — | |
| VPT-ShallowBackbone=ViT-B, Pre-training Method=MAE, Pre-training Dataset=ImageNet-1K, Tuning Depth=Shallow2024.02 | 69.15 | — | |
| AdaLNBackbone=ViT-L/162023.03 | — | 700 | |
| AdaLNBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 40 | |
| BitFitBackbone=ViT-L/162023.03 | — | 720 | |
| BitFitBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 40 | |
| Full FTBackbone=ViT-L/162023.03 | — | 60 | |
| Full FTBackbone=SWIN-L, % Trainable parameters=100%, No backbone backpropagation=false2023.03 | — | 50 | |
| In. LPBackbone=ViT-L/162023.03 | — | 60 | |
| In. LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=true2023.03 | — | 50 | |
| In. MLP-3Backbone=ViT-L/162023.03 | — | 50 | |
| In. MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=true2023.03 | — | 50 | |
| InCABackbone=ViT-L/162023.03 | — | 30 | |
| InCABackbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | — | 30 | |
| InCA (last)Backbone=ViT-L/162023.03 | — | 40 | |
| InCA (last)Backbone=SWIN-L, % Trainable parameters=3.7%, No backbone backpropagation=true2023.03 | — | 40 | |
| LoRABackbone=ViT-L/162023.03 | — | 400 | |
| LoRABackbone=SWIN-L, % Trainable parameters=0.8%, No backbone backpropagation=false2023.03 | — | 40 | |
| LPBackbone=ViT-L/162023.03 | — | 110 | |
| LPBackbone=SWIN-L, % Trainable parameters=0.1%, No backbone backpropagation=false2023.03 | — | 50 | |
| MLP-3Backbone=ViT-L/162023.03 | — | 70 | |
| MLP-3Backbone=SWIN-L, % Trainable parameters=2.8%, No backbone backpropagation=false2023.03 | — | 50 | |
| VPTBackbone=ViT-L/162023.03 | — | 220 |