Image Classification on VTAB 1k (test)
89.09Accuracy (Natural)ViT-22B
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ViT-22BEvaluation Protocol=Finetuning, Resolution=224, Seeds=32023.02 | 89.09 | 87.08 | 61.83 | 76.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-22BEvaluation Protocol=H2T (Head2Toe), Resolution=224, Seeds=32023.02 | 84.6 | 88.61 | 48.19 | 70.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ComBoFoundation Model=Top two models, Evaluation Protocol=Probing, Model Selection Mechanism=task-relevance estimation2025.12 | 84 | 86.3 | 65.3 | — | 80.5 | 95.1 | 78.9 | 99.7 | 93.3 | 87.3 | 53.4 | 85.3 | 96.9 | 89.9 | 73.3 | 92 | 60.9 | 55 | 82.2 | 90.6 | 52.7 | 33.9 | 55.3 | — | — | — | 78.6 | |
| ComBo (Top two models)Protocol=Probing, Selection=Task-relevance estimation mechanism, Candidate Backbones=DFN CLIP, DINOv2, SAM, SigLIP2025.12 | 84 | 86.3 | 65.3 | — | 80.5 | 95.1 | 78.9 | 99.7 | 93.3 | 87.3 | 53.4 | 85.3 | 96.9 | 89.9 | 73.3 | 92 | 60.9 | 55 | 82.2 | 90.6 | 52.7 | 33.9 | 55.3 | — | — | — | 78.6 | |
| RLRRBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.822024.03 | 83.9 | 86.4 | 61.9 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RADIOv2.5Evaluation Protocol=Distilling and tuning, Tuning Module=Adapter+2025.12 | 83.8 | 86.6 | 62.1 | — | 81.8 | 91.2 | 77.5 | 97.2 | 89.3 | 93.9 | 55.7 | 86.5 | 97.1 | 89.3 | 73.5 | 86.1 | 58.6 | 54.9 | 81.8 | 85.6 | 54.7 | 33.1 | 41.9 | — | — | — | 77.5 | |
| RADIOv2.5Protocol=Tuning with Adapter+, Backbone=Distilled RADIOv2.52025.12 | 83.8 | 86.6 | 62.1 | — | 81.8 | 91.2 | 77.5 | 97.2 | 89.3 | 93.9 | 55.7 | 86.5 | 97.1 | 89.3 | 73.5 | 86.1 | 58.6 | 54.9 | 81.8 | 85.6 | 54.7 | 33.1 | 41.9 | — | — | — | 77.5 | |
| RLRRBackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=true, Params.(M)=0.332024.10 | 83.7 | 92 | 77.2 | 75.1 | 76.7 | 92.7 | 76.3 | 99.6 | 92.6 | 91.8 | — | 87.8 | 56 | 83.7 | 96.2 | 76.3 | 89.1 | 83.3 | 83 | 87.3 | 80.4 | 63.3 | 54.5 | — | — | — | — | |
| HTABackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=true, Params.(M)=0.222024.10 | 83.7 | 92.2 | 77.5 | 75.7 | 79 | 92.8 | 77.6 | 99.6 | 92.4 | 89.4 | — | 88.2 | 55.1 | 83.7 | 96.1 | 76.4 | 89.7 | 82 | 85.1 | 87.6 | 84.2 | 61.7 | 53.6 | — | — | — | — | |
| ComBoFoundation Model=All four models (DFN CLIP, DINOv2, SAM, SigLIP), Evaluation Protocol=Probing2025.12 | 83.3 | 86.5 | 64.8 | — | 79.2 | 95.4 | 79.1 | 99.6 | 92.6 | 86.8 | 50.4 | 84.9 | 97 | 90.5 | 73.5 | 91.5 | 61.4 | 54.1 | 82.3 | 89.7 | 51.5 | 34.1 | 54 | — | — | — | 78.2 | |
| Adapter+Protocol=Tuning (backpropagating through adapted model), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 83.3 | 86.2 | 63.3 | — | 83.7 | 94.2 | 71.5 | 99.3 | 90.6 | 88.2 | 55.8 | 87.5 | 97 | 87.4 | 72.9 | 82.9 | 60.9 | 53.7 | 80.8 | 88.4 | 55.2 | 37.3 | 46.9 | — | — | — | 77.6 | |
| ComBo (All four models)Protocol=Probing, Backbone=DFN CLIP, DINOv2, SAM, SigLIP2025.12 | 83.3 | 86.5 | 64.8 | — | 79.2 | 95.4 | 79.1 | 99.6 | 92.6 | 86.8 | 50.4 | 84.9 | 97 | 90.5 | 73.5 | 91.5 | 61.4 | 54.1 | 82.3 | 89.7 | 51.5 | 34.1 | 54 | — | — | — | 78.2 | |
| RLRRBackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=false, Params.(M)=0.332024.10 | 82.7 | 91 | 76.4 | 74.5 | 75.6 | 92.4 | 72.9 | 99.3 | 91.5 | 89.8 | — | 86.8 | 57 | 82.7 | 95.2 | 75.9 | 85.3 | 82.1 | 83.9 | 85.8 | 79.7 | 64.2 | 53.9 | — | — | — | — | |
| ComBoFoundation Model=DINOv2, Evaluation Protocol=Probing2025.12 | 82.6 | 85.9 | 65 | — | 79.4 | 94.7 | 78.4 | 99.7 | 91.1 | 85.9 | 49.3 | 86 | 96.2 | 88.3 | 73.2 | 92.6 | 60.4 | 51.8 | 82 | 88.2 | 53.3 | 36.4 | 55.6 | — | — | — | 77.9 | |
| ComBo (DINOv2)Protocol=Probing, Backbone=DINOv22025.12 | 82.6 | 85.9 | 65 | — | 79.4 | 94.7 | 78.4 | 99.7 | 91.1 | 85.9 | 49.3 | 86 | 96.2 | 88.3 | 73.2 | 92.6 | 60.4 | 51.8 | 82 | 88.2 | 53.3 | 36.4 | 55.6 | — | — | — | 77.9 | |
| VPT-DeepBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.492024.03 | 82.5 | 83.9 | 54.1 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DeepProtocol=Tuning (backpropagating through adapted model), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 82.5 | 84.6 | 62.1 | — | 83 | 93 | 71.2 | 99 | 91.3 | 84.1 | 56 | 84.9 | 96.6 | 82.5 | 74.5 | 77.5 | 58.7 | 49.7 | 79.6 | 86.2 | 56.1 | 37.9 | 50.7 | — | — | — | 76.4 | |
| HTABackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=false, Params.(M)=0.222024.10 | 82.4 | 91.7 | 76.3 | 74.7 | 76.6 | 94.3 | 72.5 | 99.3 | 91.3 | 86.2 | — | 87.6 | 56.5 | 82.4 | 95.7 | 75.7 | 85 | 81 | 84.5 | 86 | 82.6 | 63.3 | 52.5 | — | — | — | — | |
| LoRAProtocol=Tuning (backpropagating through adapted model), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 82.4 | 84.3 | 60.1 | — | 83 | 91.7 | 71.6 | 99.2 | 90.9 | 83.8 | 56.7 | 86.2 | 95.7 | 83.5 | 71.9 | 77.7 | 62.3 | 49 | 80.2 | 82.2 | 51.7 | 31 | 47 | — | — | — | 75.6 | |
| ARCBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.182024.03 | 82.3 | 85.6 | 57.3 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SNELL-8Backbone=ViT-L/16, Pre-training=Supervised2024.11 | 82.3 | 86.9 | 56.6 | 75.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSFBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.602024.03 | 81.9 | 85.2 | 59 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HTABackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.232024.10 | 81.8 | 86.7 | 61.3 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARCBackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=true, Params.(M)=0.132024.10 | 81.8 | 92 | 76.6 | 74.3 | 71.2 | 90.9 | 75.9 | 99.5 | 92.1 | 90.8 | — | 87.4 | 52 | 81.8 | 96.5 | 76.4 | 87.6 | 81.7 | 81 | 87 | 83.3 | 61.1 | 54.6 | — | — | — | — | |
| ARCBackbone=ViT-B/16, Pre-trained=ImageNet-21K, AugReg=false, Params.(M)=0.132024.10 | 81.6 | 90.3 | 75.7 | 73.4 | 72.2 | 90.1 | 72.7 | 99 | 91 | 91.9 | — | 84.9 | 54.4 | 81.6 | 95.7 | 75.8 | 86.7 | 81.6 | 79.2 | 85.8 | 80.7 | 67.1 | 48.7 | — | — | — | — | |
| SSFBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.242024.10 | 81.6 | 91.7 | 70.8 | 73.1 | 69 | 92.6 | 75.1 | 99.4 | 91.8 | 90.2 | — | 87.4 | 52.9 | 81.6 | 95.9 | 86.6 | 75.5 | 77.3 | 54.9 | 75.9 | 62.3 | 53.3 | 80.6 | — | — | — | — | |
| LoRABackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.742024.03 | 81.4 | 85 | 57.3 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLRRBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.412024.03 | 81.3 | 86.7 | 59 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RLRRBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.412024.10 | 81.3 | 86.7 | 59 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-8Backbone=ViT-L/16, Pre-training=Supervised2024.11 | 81.2 | 86.6 | 53.4 | 73.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-22BEvaluation Protocol=Linear, Resolution=224, Seeds=32023.02 | 80.86 | 87.05 | 35.7 | 63.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SMPProtocol=Probing (no backpropagation), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 80.7 | 84.8 | 55.4 | — | 79.3 | 90.9 | 74.9 | 99.3 | 90.4 | 75 | 55.3 | 84.8 | 96.3 | 83.1 | 75 | 77.5 | 58 | 40.8 | 67.5 | 72.5 | 44.5 | 33 | 49 | — | — | — | 73.6 | |
| AdaptFormerBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.162024.10 | 80.6 | 89.4 | 74.7 | 72.3 | 70.8 | 91.2 | 70.5 | 99.1 | 90.9 | 86.6 | — | 83 | 54.8 | 80.6 | 95.8 | 76.3 | 84.4 | 80.3 | 76.3 | 84.9 | 81.9 | 64.3 | 49.3 | — | — | — | — | |
| FacT-TK<32Backbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.072024.10 | 80.6 | 90.5 | 75.9 | 73.2 | 70.6 | 90.6 | 70.8 | 99.1 | 90.7 | 88.6 | — | 84.8 | 54.1 | 80.6 | 96.2 | 75.7 | 84.5 | 80.7 | 80.8 | 85.3 | 82.6 | 68.2 | 49.8 | — | — | — | — | |
| ComBoFoundation Model=SigLIP, Evaluation Protocol=Probing2025.12 | 80.5 | 85.4 | 62.6 | — | 66.6 | 94 | 79.2 | 98.7 | 92.4 | 79.2 | 53.1 | 83 | 96 | 89.6 | 73.2 | 88.8 | 60 | 54.5 | 81.6 | 85 | 48.9 | 32.8 | 48.9 | — | — | — | 76.2 | |
| ComBo (SigLIP)Protocol=Probing, Backbone=SigLIP2025.12 | 80.5 | 85.4 | 62.6 | — | 66.6 | 94 | 79.2 | 98.7 | 92.4 | 79.2 | 53.1 | 83 | 96 | 89.6 | 73.2 | 88.8 | 60 | 54.5 | 81.6 | 85 | 48.9 | 32.8 | 48.9 | — | — | — | 76.2 | |
| All ExpertsPre-training Dataset=IN21k + JFT, Expert Architecture=All Experts (Ensemble/Routed), Expert Selection Strategy=kNN2020.09 | 80.2 | 84 | 59.5 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Head2ToeProtocol=Probing (no backpropagation), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 80.2 | 84.7 | 47.7 | — | 75.3 | 90.9 | 75 | 99.5 | 86.1 | 83.5 | 50.9 | 84.4 | 95.7 | 84.4 | 74.3 | 51.7 | 59.4 | 44 | 65.6 | 47.1 | 40.3 | 32.5 | 41.1 | — | — | — | 70.9 | |
| All ExpertsPre-training Dataset=JFT, Expert Architecture=All Experts (Ensemble/Routed), Expert Selection Strategy=kNN2020.09 | 80 | 83.7 | 58.6 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-ShallowBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.052024.03 | 79.9 | 82.5 | 37.8 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-ShallowBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.052024.10 | 79.9 | 82.5 | 37.8 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullPre-training Dataset=JFT, Expert Architecture=Full, Expert Selection Strategy=kNN2020.09 | 79.7 | 83.6 | 55.3 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ComBoProtocol=Probing (no backpropagation), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 79.7 | 84.5 | 59.5 | — | 76.7 | 91.3 | 69.8 | 99.3 | 90 | 81.4 | 49.3 | 84.9 | 96.6 | 84.6 | 71.8 | 81.7 | 60 | 46.5 | 77.9 | 89 | 47.6 | 28.4 | 45.1 | — | — | — | 74.6 | |
| Auto-PromptingPretrained=MoCo v3 [23], Tuned(%)=0.25, Backbone=ViT-Base2026.06 | 79.6 | 86.86 | 61.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SNELL-8Backbone=ViT-H/14, Pre-training=Supervised2024.11 | 79.5 | 85.1 | 56.9 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LORABackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.292024.10 | 79.5 | 90.1 | 74.8 | 72.3 | 67.1 | 91.4 | 69.4 | 98.8 | 90.4 | 85.3 | — | 84.9 | 54 | 79.5 | 95.3 | 73.6 | 84.4 | 78.5 | 75.7 | 84.6 | 82.9 | 69.2 | 49.8 | — | — | — | — | |
| RLRRBackbone=ViT-Huge, Params.(M)=1.332024.03 | 79.4 | 85.1 | 59 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ComBoFoundation Model=DFN CLIP, Evaluation Protocol=Probing2025.12 | 79.3 | 85.8 | 61.6 | — | 70.8 | 94 | 77.2 | 97.5 | 87.9 | 83.1 | 44.4 | 84.3 | 96.7 | 89.1 | 73.3 | 87.2 | 60.7 | 51.6 | 79.6 | 81.9 | 50.9 | 30 | 51.1 | — | — | — | 75.6 | |
| ComBo (DFN CLIP)Protocol=Probing, Backbone=DFN CLIP2025.12 | 79.3 | 85.8 | 61.6 | — | 70.8 | 94 | 77.2 | 97.5 | 87.9 | 83.1 | 44.4 | 84.3 | 96.7 | 89.1 | 73.3 | 87.2 | 60.7 | 51.6 | 79.6 | 81.9 | 50.9 | 30 | 51.1 | — | — | — | 75.6 | |
| ARCBackbone=ViT-Huge, Params.(M)=0.222024.03 | 79.1 | 84.8 | 53.7 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full fine-tuningBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=86.802024.03 | 79.1 | 86.2 | 59.7 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full fine-tuningBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=86.802024.10 | 79.1 | 86.2 | 59.7 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptersPre-training Dataset=JFT, Expert Architecture=Adapters, Expert Selection Strategy=kNN2020.09 | 79 | 81.3 | 59.1 | 71.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSFBackbone=ViT-Huge, Params.(M)=0.972024.03 | 79 | 83.1 | 56.6 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARCBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.272024.03 | 79 | 86.6 | 59.9 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARCBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.272024.10 | 79 | 86.6 | 59.9 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdapterBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.162024.10 | 79 | 89.5 | 73.7 | 71.4 | 69.2 | 90.1 | 68 | 98.8 | 89.9 | 82.8 | — | 84 | 54.3 | 79 | 94.9 | 75.5 | 81.9 | 78.3 | 74.8 | 84.1 | 80.9 | 65.3 | 48.6 | — | — | — | — | |
| VPT-ShallowBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=0.152024.03 | 78.7 | 79.9 | 40.6 | 62.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullProtocol=Tuning (backpropagating through adapted model), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 78.6 | 86.3 | 57.8 | — | 73.2 | 92.6 | 70.4 | 97.9 | 86.2 | 90.6 | 39.6 | 87.1 | 96.6 | 87.5 | 74 | 66.6 | 61 | 49.8 | 79.7 | 82.6 | 51.9 | 33.5 | 37 | — | — | — | 74.2 | |
| VPT-DeepBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.602024.10 | 78.5 | 89 | 69.5 | 69.4 | 78.8 | 90.8 | 65.8 | 98 | 88.3 | 78.1 | — | 81.8 | 49.6 | 78.5 | 96.1 | 68.4 | 83.4 | 72.8 | 73.6 | 82.4 | 68.5 | 60 | 46.5 | — | — | — | — | |
| VPT-DEEPTotal parameters=1.18x, Scope: Input=true, Scope: Backbone=true, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 78.48 | 82.43 | 54.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6 | 2 | 8 | — | |
| FullPre-training Dataset=ImageNet-21k, Expert Architecture=Full, Expert Selection Strategy=kNN2020.09 | 78.3 | 83.4 | 59.4 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| All ExpertsPre-training Dataset=ImageNet-21k, Expert Architecture=All Experts (Ensemble/Routed), Expert Selection Strategy=kNN2020.09 | 78.3 | 83.6 | 58.8 | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptersPre-training Dataset=ImageNet-21k, Expert Architecture=Adapters, Expert Selection Strategy=kNN2020.09 | 78.1 | 83.5 | 57.5 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DeepBackbone=ViT-Huge, Params.(M)=0.962024.03 | 77.9 | 83.3 | 52.2 | 68.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-8Backbone=ViT-H/14, Pre-training=Supervised2024.11 | 77.9 | 84.8 | 55.9 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselinePre-training Dataset=ImageNet-21k, Expert Architecture=N/A (Single Model)2020.09 | 77.7 | 82 | 56.8 | 69.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VFPTPretrained=MoCo v3 [23], Tuned(%)=0.22, Backbone=ViT-Base2026.06 | 77.47 | 85.76 | 58.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselinePre-training Dataset=JFT, Expert Architecture=N/A (Single Model)2020.09 | 77.4 | 81.6 | 57.2 | 69.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRABackbone=ViT-Huge, Params.(M)=1.212024.03 | 77.1 | 83.5 | 55.4 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-SHALLOWTotal parameters=1.04x, Scope: Input=true, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 76.81 | 79.66 | 46.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 4 | 0 | 4 | — | |
| VPT-DeepBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.222024.03 | 76.8 | 84.5 | 53.4 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-DeepBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.222024.10 | 76.8 | 84.5 | 53.4 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPT-ShallowBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.112024.10 | 76.8 | 85.1 | 64.2 | 64.9 | 77.7 | 86.9 | 62.6 | 97.5 | 87.3 | 74.5 | — | 78.2 | 51.2 | 76.8 | 92 | 72.9 | 75.6 | 67.1 | 68.7 | 79.7 | 50.5 | 58.6 | 40.5 | — | — | — | — | |
| RLRRBackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=0.332024.03 | 76.6 | 86.2 | 62.1 | 73.1 | 61.8 | 91.7 | 68.6 | 91.6 | 89.5 | 91.5 | 41.7 | 87.9 | 96 | 85.4 | 75.4 | 79.3 | 64.6 | 51.5 | 81.4 | 77.5 | 50.4 | 35.6 | 45.9 | — | — | — | — | |
| ARCBackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=0.132024.03 | 76.2 | 86.2 | 62.3 | 72.4 | 60 | 91.3 | 67.9 | 92.8 | 89.3 | 91.4 | 40.9 | 87.5 | 95.6 | 86.1 | 75.6 | 83 | 64.2 | 50.2 | 80.6 | 85 | 53 | 34.6 | 47.4 | — | — | — | — | |
| Full fine-tuningBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=85.802024.10 | 75.9 | 87.7 | 65.1 | 65.6 | 68.9 | 87.7 | 64.3 | 97.2 | 86.9 | 87.4 | — | 79.7 | 38.8 | 75.9 | 95.7 | 73.9 | 84.2 | 65.5 | 57.5 | 83.4 | 56.3 | 58.6 | 41.7 | — | — | — | — | |
| FULLTotal parameters=24.02x, Scope: Input=false, Scope: Backbone=false, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 75.88 | 83.36 | 47.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gated Prompt TuningSSL=MoCo v3, Total Params=1.01x2023.06 | 74.84 | 83.38 | 49.1 | 65.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPTPretrained=MoCo v3 [23], Tuned(%)=0.06, Backbone=ViT-Base2026.06 | 74.84 | 83.38 | 49.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LORABackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=0.302024.03 | 74.8 | 85.1 | 61.4 | 71.3 | 58.8 | 90.8 | 66 | 91.8 | 88.1 | 87.6 | 40.6 | 86.4 | 95.3 | 83.4 | 75.5 | 83 | 64.6 | 51.3 | 81.9 | 83.2 | 47.5 | 32.4 | 47.3 | — | — | — | — | |
| VPT-ShallowBackbone=ViT-Huge, Params.(M)=0.182024.03 | 74.8 | 81.2 | 43 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full fine-tuningBackbone=ViT-Large, Pre-trained=ImageNet-21k, Params (M)=303.402024.03 | 74.7 | 83.8 | 48.1 | 65.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DA-VPTPretrained=MoCo v3 [23], Backbone=ViT-Base2026.06 | 74.24 | 83.21 | 55.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdapterBackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=0.982024.03 | 74.2 | 82.7 | 47.7 | 64.8 | 73 | 88.2 | 69.3 | 90.7 | 87.4 | 69.9 | 40.9 | 82.4 | 93.4 | 80.5 | 74.3 | 55.6 | 56.1 | 39.1 | 73.9 | 60.5 | 40.2 | 19 | 37.1 | — | — | — | — | |
| BiasBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.252024.03 | 74.2 | 80.1 | 42.4 | 62.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiasBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.252024.10 | 74.2 | 80.1 | 42.4 | 62.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdapterPretrained=MoCo v3 [23], Tuned(%)=1.12, Backbone=ViT-Base2026.06 | 74.19 | 82.66 | 47.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear probingProtocol=Probing (no backpropagation), Backbone=ViT-B/16, Pre-training=ImageNet-21K2025.12 | 73.9 | 79.5 | 29.6 | — | 78.1 | 88.1 | 69 | 99.1 | 90 | 36 | 56.9 | 79.8 | 90.7 | 73.7 | 73.7 | 32.4 | 30.5 | 35.9 | 61.9 | 11.2 | 26.2 | 14.3 | 24.5 | — | — | — | 61 | |
| Linear probingBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=0.052024.03 | 73.5 | 80.8 | 33.5 | 58.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear probingBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=0.052024.10 | 73.5 | 80.8 | 33.5 | 58.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BIASTotal parameters=1.05x, Scope: Input=false, Scope: Backbone=true, Extra parameters=false, Backbone: ViT-B/16=85.8M, Pre-training: supervised ImageNet-21k=true2022.03 | 73.3 | 78.25 | 44.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 3 | 0 | 2 | — | |
| BiasBackbone=ViT-B/16, Pre-trained=ImageNet-21K, Params.(M)=0.142024.10 | 73.3 | 85.2 | 61.6 | 62.1 | 72.8 | 87 | 59.2 | 97.5 | 85.3 | 59.9 | — | 78.7 | 51.4 | 73.3 | 91.6 | 69.8 | 72.9 | 55.9 | 66.6 | 78.3 | 61.5 | 55.6 | 32.4 | — | — | — | — | |
| PartialBackbone=Swin Transformer, Pre-training=ImageNet-21k, Total Params.(M)=12.652024.03 | 73.1 | 81.7 | 35 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PartialBackbone=Swin Transformer, Pre-trained=ImageNet-21k, Params.(M)=12.652024.10 | 73.1 | 81.7 | 35 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BiasBackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=0.142024.03 | 72.9 | 81.1 | 53.4 | 66.4 | 65.5 | 89.2 | 62.9 | 88.9 | 80.5 | 82.7 | 40.5 | 80.9 | 95.2 | 77.7 | 70.8 | 71.4 | 59.4 | 39.8 | 77.4 | 70.2 | 49 | 17.5 | 42.8 | — | — | — | — | |
| BiasPretrained=MoCo v3 [23], Tuned(%)=0.16, Backbone=ViT-Base2026.06 | 72.89 | 81.14 | 53.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Partial-1Pretrained=MoCo v3 [23], Tuned(%)=8.30, Backbone=ViT-Base2026.06 | 72.31 | 84.58 | 47.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoR-VPPretrained=MoCo v3 [23], Tuned(%)=0.29, Backbone=ViT-Base2026.06 | 72.28 | 82.89 | 46.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Full fine-tuningBackbone=ViT-Base, Pre-training=Moco V3 self-supervised, Params (M)=85.692024.03 | 72 | 84.7 | 52 | 66.2 | 57.6 | 91 | 64.6 | 91.5 | 79.9 | 89.8 | 29.1 | 85.1 | 96.4 | 83.1 | 74.3 | 55.1 | 56.9 | 44.7 | 77.9 | 63.8 | 49 | 31.5 | 36.9 | — | — | — | — |