Visual Adaptation on VTAB 1k (test)
82.5Natural AccuracyVPT-Deep
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VPT-DeepBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.492023.10 | 82.5 | 83.9 | 54.1 | 70.8 | |
| ARCBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.182023.10 | 82.3 | 85.6 | 57.3 | 72.5 | |
| LORABackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.742023.10 | 81.4 | 85 | 57.3 | 72 | |
| ARCBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=0.222023.10 | 79.1 | 84.8 | 53.7 | 69.6 | |
| VPT-ShallowBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.152023.10 | 78.7 | 79.9 | 40.6 | 62.9 | |
| VPT-DeepBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=0.962023.10 | 77.9 | 83.3 | 52.2 | 68.2 | |
| LORABackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=1.212023.10 | 77.1 | 83.5 | 55.4 | 69.3 | |
| VPT-ShallowBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=0.182023.10 | 74.8 | 81.2 | 43 | 62.8 | |
| Full fine-tuningBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=303.42023.10 | 74.7 | 83.8 | 48.1 | 65.4 | |
| Linear probingBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.052023.10 | 70.9 | 69.1 | 25.8 | 51.5 | |
| Full fine-tuningBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=630.92023.10 | 70.9 | 83.6 | 46 | 63.1 | |
| BiasBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=0.322023.10 | 70.5 | 73.8 | 41.2 | 58.9 | |
| BiasBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=0.522023.10 | 70.3 | 78.9 | 41.7 | 60.1 | |
| AdapterBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params.=2.382023.10 | 68.6 | 73.5 | 29 | 52.9 | |
| AdapterBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=5.782023.10 | 68.1 | 76.4 | 24.5 | 51.5 | |
| Linear probingBackbone=ViT-Huge, Pre-trained=ImageNet-21k, Params.=0.062023.10 | 67.9 | 79 | 26.1 | 52.7 |