Image Classification on Flowers102
99.43AccuracyAdapterTune
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AdapterTuneBackbone=ViT-B/162026.03 | 99.43 | — | — | — | — | — | — | — | — | — | — | |
| DoRA (r=8)Backbone=ViT-B, #Params=1.41M2024.05 | 99.3 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^B (r=2)Backbone=ViT-B, #Params=0.28M2024.05 | 99.28 | — | — | — | — | — | — | — | — | — | — | |
| LoRA (r=8)Backbone=ViT-B, #Params=1.32M2024.05 | 99.23 | — | — | — | — | — | — | — | — | — | — | |
| SOT-GLPShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 99.2 | — | — | — | — | — | — | — | — | — | — | |
| DoRA (r=1)Backbone=ViT-B, #Params=0.25M2024.05 | 99.15 | — | — | — | — | — | — | — | — | — | — | |
| VeRABackbone=ViT-L, #Params=61.4K2024.05 | 98.94 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^PBackbone=ViT-B, #Params=18.5K2024.05 | 98.93 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^B (r=8)Backbone=ViT-B, #Params=0.94M2024.05 | 98.88 | — | — | — | — | — | — | — | — | — | — | |
| GalLoPShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 98.8 | — | — | — | — | — | — | — | — | — | — | |
| HeadBackbone=ViT-L2024.05 | 98.75 | — | — | — | — | — | — | — | — | — | — | |
| IOTAShot=16-shot, Backbone=ViT-B/162026.01 | 98.74 | — | — | — | — | — | — | — | — | — | — | |
| Head-OnlyBackbone=ViT-B/162026.03 | 98.71 | — | — | — | — | — | — | — | — | — | — | |
| BOFT (b=4, m=1)Backbone=ViT-B, #Params=0.11M2024.05 | 98.59 | — | — | — | — | — | — | — | — | — | — | |
| VeRABackbone=ViT-B, #Params=24.6K2024.05 | 98.59 | — | — | — | — | — | — | — | — | — | — | |
| BOFT (b=2, m=2)Backbone=ViT-B, #Params=0.07M2024.05 | 98.54 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^B (r=4)Backbone=ViT-B, #Params=0.50M2024.05 | 98.52 | — | — | — | — | — | — | — | — | — | — | |
| HeadBackbone=ViT-B2024.05 | 98.42 | — | — | — | — | — | — | — | — | — | — | |
| Full-FTBackbone=ViT-B, #Params=85.8M2024.05 | 98.37 | — | — | — | — | — | — | — | — | — | — | |
| TOGAShots=16, Venue=-2026.03 | 98.3 | — | — | — | — | — | — | — | — | — | — | |
| LoRA (r=1)Backbone=ViT-L, #Params=0.44M2024.05 | 98.28 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^B (r=2)Backbone=ViT-L, #Params=0.74M2024.05 | 98.24 | — | — | — | — | — | — | — | — | — | — | |
| DoRA (r=1)Backbone=ViT-L, #Params=0.66M2024.05 | 98.11 | — | — | — | — | — | — | — | — | — | — | |
| FLAVALinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 98.1 | — | — | — | — | — | — | — | — | — | — | |
| DoRA (r=8)Backbone=ViT-L, #Params=3.76M2024.05 | 98 | — | — | — | — | — | — | — | — | — | — | |
| BOFT (b=2, m=2)Backbone=ViT-L, #Params=0.20M2024.05 | 97.95 | — | — | — | — | — | — | — | — | — | — | |
| BOFT (b=4, m=1)Backbone=ViT-L, #Params=0.30M2024.05 | 97.95 | — | — | — | — | — | — | — | — | — | — | |
| LoRA (r=8)Backbone=ViT-L, #Params=0.35M2024.05 | 97.93 | — | — | — | — | — | — | — | — | — | — | |
| Full dataBackbone=ViT-B/32, Evaluation Protocol=Full Data2023.11 | 97.9 | — | — | — | — | — | — | — | — | — | — | |
| PS-CBMBackbone=CLIP RN502025.11 | 97.9 | — | — | — | — | — | 74.9 | — | — | — | — | |
| SVFT^B (r=8)Backbone=ViT-L, #Params=2.50M2024.05 | 97.89 | — | — | — | — | — | — | — | — | — | — | |
| Full-FTBackbone=ViT-L, #Params=303.3M2024.05 | 97.87 | — | — | — | — | — | — | — | — | — | — | |
| IOTAShot=8/stage, Curriculum Stage=Hard curriculum stage, Base Learner=ViT-B/162026.01 | 97.73 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^B (r=4)Backbone=ViT-L, #Params=1.32M2024.05 | 97.71 | — | — | — | — | — | — | — | — | — | — | |
| PLOTShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 97.6 | — | — | — | — | — | — | — | — | — | — | |
| PromptSRCShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 97.6 | — | — | — | — | — | — | — | — | — | — | |
| SVFT^PBackbone=ViT-L, #Params=49.2K2024.05 | 97.56 | — | — | — | — | — | — | — | — | — | — | |
| CS-AlignerBackbone=ViT-B/16, Number of Shots=16, Evaluation Protocol=fine-tuned2025.02 | 97.5 | — | — | — | — | — | — | — | — | — | — | |
| IOTAShot=8-shot, Backbone=ViT-B/162026.01 | 97.48 | — | — | — | — | — | — | — | — | — | — | |
| Linear ProbeBackbone=CLIP RN502025.11 | 97.4 | — | — | — | — | — | — | — | — | — | — | |
| CLIP-Adapter (best α)Backbone=ViT-B/16, Shots=16, Blending ratio (alpha) selection strategy=Best residual ratio per dataset (oracle)2026.03 | 97.4 | — | — | — | — | — | — | — | — | — | — | |
| CLIP-AdapterBackbone=ViT-B/16, Shots=16, Blending ratio (alpha)=best2026.03 | 97.4 | — | — | — | — | — | — | — | — | — | — | |
| Linear ProbeShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 97.4 | — | — | — | — | — | — | — | — | — | — | |
| TOGAShots=8, Venue=-2026.03 | 97.3 | — | — | — | — | — | — | — | — | — | — | |
| HOSO-AdapterBackbone=ViT-B/16, Shots=16, Blending ratio (alpha) selection strategy=Optimised on hold-one-shot-out cache2026.03 | 97.23 | — | — | — | — | — | — | — | — | — | — | |
| HOSO-AdapterBackbone=ViT-B/16, Shots=16, Number of runs=32026.03 | 97.23 | — | — | — | — | — | — | — | — | — | — | |
| ProTextShot=16-shot, Backbone=ViT-B/162026.01 | 97.12 | — | — | — | — | — | — | — | — | — | — | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 97.1 | — | — | — | — | — | — | — | — | — | — | |
| mPLUG-2 baseEval=LE, Multi-modal pre-training data size=17M2023.01 | 97.1 | — | — | — | 90.1 | — | — | — | — | — | — | |
| VLG-CBMBackbone=CLIP RN502025.11 | 97.1 | — | — | — | — | — | 72.5 | — | — | — | — | |
| CoOpShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 97.1 | — | — | — | — | — | — | — | — | — | — | |
| MaPLeShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 97 | — | — | — | — | — | — | — | — | — | — | |
| Entropy + PCB(AS)Backbone=ViT-B/32, Active Learning Strategy=Entropy, Integration Method=PCB(AS), Number of Rounds=82023.11 | 96.94 | — | — | — | — | — | — | — | — | — | — | |
| DaVinciLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 96.9 | — | — | — | — | — | — | — | — | — | — | |
| OFAEval=LE, Multi-modal pre-training data size=21M2023.01 | 96.9 | — | — | — | 87.9 | — | — | — | — | — | — | |
| LoRA (r=1)Backbone=ViT-B, #Params=0.16M2024.05 | 96.88 | — | — | — | — | — | — | — | — | — | — | |
| ProDAShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 96.8 | — | — | — | — | — | — | — | — | — | — | |
| CoOpShot=16-shot, Backbone=ViT-B/162026.01 | 96.79 | — | — | — | — | — | — | — | — | — | — | |
| BADGE + PCB(AS)Backbone=ViT-B/32, Active Learning Strategy=BADGE, Integration Method=PCB(AS), Number of Rounds=82023.11 | 96.71 | — | — | — | — | — | — | — | — | — | — | |
| LP++Shot=16-shot, Backbone=ViT-B/162026.01 | 96.71 | — | — | — | — | — | — | — | — | — | — | |
| LaBoBackbone=CLIP RN502025.11 | 96.6 | — | — | — | — | — | 66.7 | — | — | — | — | |
| DN-CBMBackbone=CLIP RN502025.11 | 96.6 | — | — | — | — | — | 65.8 | — | — | — | — | |
| V2C-CBMBackbone=CLIP RN502025.11 | 96.6 | — | — | — | — | — | 68.2 | — | — | — | — | |
| IOTAShot=8/stage, Curriculum Stage=Easy curriculum stage, Base Learner=ViT-B/162026.01 | 96.59 | — | — | — | — | — | — | — | — | — | — | |
| Clip-AdapterShot=16-shot, Backbone=ViT-B/162026.01 | 96.59 | — | — | — | — | — | — | — | — | — | — | |
| BADGE + ASBackbone=ViT-B/32, Active Learning Strategy=BADGE, Integration Method=AS, Number of Rounds=82023.11 | 96.44 | — | — | — | — | — | — | — | — | — | — | |
| X-FM_baseLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 96.4 | — | — | — | — | — | — | — | — | — | — | |
| X2-VLMEval=LE, Multi-modal pre-training data size=4M2023.01 | 96.4 | — | — | — | 86.3 | — | — | — | — | — | — | |
| X-FM baseEval=LE, Multi-modal pre-training data size=4M2023.01 | 96.4 | — | — | — | 89.8 | — | — | — | — | — | — | |
| TOGAShots=4, Venue=-2026.03 | 96.4 | — | — | — | — | — | — | — | — | — | — | |
| BADGE + PCB(AE)Backbone=ViT-B/32, Active Learning Strategy=BADGE, Integration Method=PCB(AE), Number of Rounds=82023.11 | 96.35 | — | — | — | — | — | — | — | — | — | — | |
| Entropy + PCB(AE)Backbone=ViT-B/32, Active Learning Strategy=Entropy, Integration Method=PCB(AE), Number of Rounds=82023.11 | 96.33 | — | — | — | — | — | — | — | — | — | — | |
| BADGEBackbone=ViT-B/32, Active Learning Strategy=BADGE, Number of Rounds=82023.11 | 96.33 | — | — | — | — | — | — | — | — | — | — | |
| LoCoOpShots=16, Backbone=ViT-B/16, Pre-training=CLIP2026.03 | 96.3 | — | — | — | — | — | — | — | — | — | — | |
| RandAugmentModel=ViT-Small, Evaluation Protocol=5-way, 1-shot2026.02 | 96.26 | — | — | — | — | — | — | — | — | — | — | |
| BADGE + AEBackbone=ViT-B/32, Active Learning Strategy=BADGE, Integration Method=AE, Number of Rounds=82023.11 | 96.24 | — | — | — | — | — | — | — | — | — | — | |
| GraphAdapterSetting=16-shot2023.09 | 96.23 | — | — | — | — | — | — | — | — | — | — | |
| Entropy + PCBBackbone=ViT-B/32, Active Learning Strategy=Entropy, Integration Method=PCB, Number of Rounds=82023.11 | 96.16 | — | — | — | — | — | — | — | — | — | — | |
| BADGE + PCBBackbone=ViT-B/32, Active Learning Strategy=BADGE, Integration Method=PCB, Number of Rounds=82023.11 | 96.12 | — | — | — | — | — | — | — | — | — | — | |
| BiSigLIPShots=16, Base Model=SigLIP, Adaptation Method=Bilinear adaptation2026.03 | 96.11 | — | — | — | — | — | — | — | — | — | 14.96 | |
| SimVLMEval=LE, Multi-modal pre-training data size=1.8B2023.01 | 96.1 | — | — | — | 86.7 | — | — | — | — | — | — | |
| Align+MixShot=16, Backbone=ResNet-502026.03 | 96.1 | — | — | — | — | — | — | — | — | — | — | |
| Entropy + AEBackbone=ViT-B/32, Active Learning Strategy=Entropy, Integration Method=AE, Number of Rounds=82023.11 | 96.06 | — | — | — | — | — | — | — | — | — | — | |
| ProTextShot=8/stage, Curriculum Stage=Hard curriculum stage, Base Learner=ViT-B/162026.01 | 96.03 | — | — | — | — | — | — | — | — | — | — | |
| CLIP-AdapterBackbone=ViT-B/16, Number of Shots=16, Evaluation Protocol=fine-tuned2025.02 | 96 | — | — | — | — | — | — | — | — | — | — | |
| IOTAShot=4/stage, Curriculum Stage=Hard curriculum stage, Base Learner=ViT-B/162026.01 | 95.94 | — | — | — | — | — | — | — | — | — | — | |
| Dual Prompt TuningBackbone=ViT-L/14, PEFT Paradigm=CoOp, Annotation Budget (B%)=5%2026.02 | 95.8 | — | — | — | — | — | — | — | — | — | — | |
| GDAShot=16, Backbone=ResNet-502026.03 | 95.8 | — | — | — | — | — | — | — | — | — | — | |
| ProGradShot=16-shot, Backbone=ViT-B/162026.01 | 95.78 | — | — | — | — | — | — | — | — | — | — | |
| Clip-AdapterShot=8/stage, Curriculum Stage=Easy curriculum stage, Base Learner=ViT-B/162026.01 | 95.74 | — | — | — | — | — | — | — | — | — | — | |
| BEiTv2Eval=LE2023.01 | 95.7 | — | — | — | 88.7 | — | — | — | — | — | — | |
| Entropy + ASBackbone=ViT-B/32, Active Learning Strategy=Entropy, Integration Method=AS, Number of Rounds=82023.11 | 95.67 | — | — | — | — | — | — | — | — | — | — | |
| CoOpShot=8/stage, Curriculum Stage=Easy curriculum stage, Base Learner=ViT-B/162026.01 | 95.62 | — | — | — | — | — | — | — | — | — | — | |
| KgCoOpShot=8/stage, Curriculum Stage=Hard curriculum stage, Base Learner=ViT-B/162026.01 | 95.62 | — | — | — | — | — | — | — | — | — | — | |
| ProTextShot=8/stage, Curriculum Stage=Easy curriculum stage, Base Learner=ViT-B/162026.01 | 95.57 | — | — | — | — | — | — | — | — | — | — | |
| EvoAug (Learned Clustering)Model=ViT-Small, Evaluation Protocol=5-way, 1-shot2026.02 | 95.47 | — | — | — | — | — | — | — | — | — | — | |
| TCPShot=16-shot, Backbone=ViT-B/162026.01 | 95.46 | — | — | — | — | — | — | — | — | — | — | |
| ProTextShot=8-shot, Backbone=ViT-B/162026.01 | 95.45 | — | — | — | — | — | — | — | — | — | — | |
| Clip-AdapterShot=8/stage, Curriculum Stage=Hard curriculum stage, Base Learner=ViT-B/162026.01 | 95.41 | — | — | — | — | — | — | — | — | — | — | |
| SV-EnsembleBackbone=DINO ViT-S/14, Evaluation Protocol=Fine-tuning, Training Duration=10 epochs, Number of Ensemble Members=42026.01 | 95.4 | — | — | — | — | — | — | 1 | 0.18 | 0.07 | — |