Visual Task Adaptation on VTAB-1k v1 (test)
79.1Mean AccuracySNELL-8
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SNELL-8Backbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 79.1 | 84.5 | 87.4 | 65.6 | |
| SPT-LORABackbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 78.7 | 83.4 | 86.7 | 65.9 | |
| SPT-AdapterBackbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 78.4 | 83.7 | 86.2 | 65.3 | |
| SPT-AdapterBackbone=Swin-B, Pre-training=Supervised2024.11 | 77.5 | 83 | 87.3 | 62.1 | |
| SNELL-8Backbone=Swin-B, Pre-training=Supervised2024.11 | 77.5 | 83.3 | 87.7 | 61.4 | |
| Adapter-8Backbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 77.5 | 83.1 | 84.9 | 64.6 | |
| SPT-LORABackbone=Swin-B, Pre-training=Supervised2024.11 | 77.2 | 83.1 | 87.4 | 60.4 | |
| LORA-8Backbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 77 | 82.2 | 84.7 | 64.1 | |
| Adapter-8Backbone=Swin-B, Pre-training=Supervised2024.11 | 76.7 | 81.7 | 87.3 | 61.2 | |
| LORA-8Backbone=Swin-B, Pre-training=Supervised2024.11 | 76.3 | 81.7 | 87.2 | 60.1 | |
| FullBackbone=Swin-B, Pre-training=Supervised2024.11 | 75 | 79.1 | 86.2 | 59.7 | |
| FullBackbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 74 | 78 | 83.7 | 60.4 | |
| VIVI-Ex(4)-Co(100%)-BigLabeled Data Percentage for Co-training=100%, Ex=4, Model Size=Big, Pre-training Strategy=Co-trained (YT8M + ImageNet)2019.12 | 71.7 | 72.5 | 84.3 | 64.7 | |
| VPT-DeepBackbone=Swin-B, Pre-training=Supervised2024.11 | 71.6 | 76.8 | 84.5 | 53.4 | |
| PiCa (r=64)#Params=0.44M, Backbone=ViT-B/162025.05 | 69.7 | 82.5 | 85.1 | 50.8 | |
| LoRA (r=8)#Params=1.32M, Backbone=ViT-B/162025.05 | 69.6 | 82.3 | 85.1 | 50.8 | |
| DoRA (r=8)#Params=1.41M, Backbone=ViT-B/162025.05 | 69.5 | 82.7 | 84.6 | 50.5 | |
| VIVI-Ex(4)-Co(100%)Labeled Data Percentage for Co-training=100%, Ex=4, Pre-training Strategy=Co-trained (YT8M + ImageNet)2019.12 | 69.4 | 69.9 | 83.3 | 62.1 | |
| VPT-DeepBackbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 68.7 | 78.5 | 83 | 44.6 | |
| SVFT^B (d=8)#Params=0.93M, Backbone=ViT-B/162025.05 | 68.4 | 82 | 84.4 | 48.6 | |
| Sup-Rot-100%Labeled Data Percentage=100%, Pre-training Strategy=Supervised with Rotation2019.12 | 68 | 73.6 | 83.1 | 55.5 | |
| VeRA (r=4096)#Params=0.45M, Backbone=ViT-B/162025.05 | 67.7 | 81.3 | 84.5 | 47.4 | |
| VIVI-Ex(4)-Co(10%)Labeled Data Percentage for Co-training=10%, Ex=4, Pre-training Strategy=Co-trained (YT8M + ImageNet)2019.12 | 67.2 | 63.3 | 82.6 | 62.9 | |
| Sup-100%Labeled Data Percentage=100%, Pre-training Strategy=Supervised2019.12 | 66.4 | 73.5 | 82.5 | 52.1 | |
| Semi-Ex-10%Labeled Data Percentage for Co-training=10%, Pre-training Strategy=Semi-Supervised2019.12 | 65.3 | 70.2 | 81.9 | 52.7 | |
| Partial-1Backbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 65 | 73.8 | 81.6 | 39.6 | |
| MLP-3Backbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 63.6 | 73.8 | 81.4 | 35.7 | |
| LinearBackbone=ConvNeXt-B, Pre-training=Supervised2024.11 | 63.6 | 74.5 | 81.5 | 34.8 | |
| VIVI-Ex(4)-BigPre-training Strategy=Self-Supervised (YT8M), Ex=4, Model Size=Big2019.12 | 63.3 | 57.5 | 81 | 59.5 | |
| Partial-1Backbone=Swin-B, Pre-training=Supervised2024.11 | 63.3 | 73.1 | 81.7 | 35 | |
| LinearBackbone=Swin-B, Pre-training=Supervised2024.11 | 62.6 | 73.5 | 80.8 | 33.5 | |
| VIVI-Ex(4)Pre-training Strategy=Self-Supervised (YT8M), Ex=42019.12 | 62.5 | 55.9 | 80.9 | 59.1 | |
| MLP-3Backbone=Swin-B, Pre-training=Supervised2024.11 | 61.5 | 73.6 | 75.2 | 35.7 | |
| Ex-ImageNetPre-training Strategy=Exemplar-based ImageNet2019.12 | 59.5 | 50.5 | 81.4 | 56.4 |