Image Classification on Oxford 102 Flowers
99.6Top-1 AccuracyHUVR
Evaluation Results
| Method | Links | |
|---|---|---|
| HUVREncoder=ViT-B, Dimension=32, Compression=HUVR, Evaluation Protocol=Linear probing2026.01 | 99.6 | |
| HUVREncoder=ViT-L, Dimension=32, Compression=HUVR, Evaluation Protocol=Linear probing2026.01 | 99.5 | |
| HUVREncoder=ViT-B, Dimension=16, Compression=HUVR, Evaluation Protocol=Linear probing2026.01 | 99.4 | |
| SigLIP 2Encoder=ViT-L, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 99.3 | |
| Core-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 99.18 | |
| DINOv3Encoder=ViT-L, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 99.1 | |
| DeiT-B⚗ ↑384#Params=88M2022.04 | 98.9 | |
| HUVREncoder=ViT-B, Dimension=8, Compression=HUVR, Evaluation Protocol=Linear probing2026.01 | 98.9 | |
| EfficientNet-B72019.06 | 98.8 | |
| EfficientNet-B7#Params=66M2022.04 | 98.8 | |
| DeiT-B⚗#Params=87M2022.04 | 98.8 | |
| SL-CE-tuningBackbone=ResNet-50, Pre-training=Supervised2021.02 | 98.78 | |
| RIFLEBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.7 | |
| L2SPBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.66 | |
| DELTABackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.65 | |
| SCLBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.65 | |
| SigLIP 2Encoder=ViT-B, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 98.6 | |
| C-RADIOv3Encoder=ViT-L, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 98.6 | |
| M&MBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| BSSBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| Bi-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.57 | |
| EfficientNet-B5#Params=30M2022.04 | 98.5 | |
| DeiT-B↑384#Params=87M2022.04 | 98.5 | |
| CE-tuningBackbone=ResNet-50, Pre-training=MoCo-v22021.02 | 98.49 | |
| DeiT-B#Params=86M2022.04 | 98.4 | |
| Mini-DeiT-B↑384#Params=44M2022.04 | 98.3 | |
| Grafit ResNet-50#Params=25M2022.04 | 98.2 | |
| AWTShots=162024.07 | 97.69 | |
| SUPEvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 97.6 | |
| DINOv3Encoder=ViT-B, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 97.3 | |
| TWISTEvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 97.1 | |
| CoOpShots=162024.07 | 97.07 | |
| BYOLEvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 97 | |
| OURSShots=8, Backbone=ViT-B/16, Templates=12025.12 | 96.9 | |
| SimCLREvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 96.6 | |
| CLIP-LoRAShots=8, Backbone=ViT-B/16, Templates=12025.12 | 96.3 | |
| RényiCLEvaluation Protocol=linear evaluation, Multi-crop Augmentation=true2022.08 | 96.2 | |
| OURSShots=8, Backbone=ViT-B/16, Templates=72025.12 | 96.2 | |
| BYOLEvaluation Protocol=Linear evaluation, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 96.1 | |
| CLIP-LoRAShots=8, Backbone=ViT-B/16, Templates=72025.12 | 95.8 | |
| FixResBackbone=InceptionResNet-V22019.06 | 95.7 | |
| InceptionResNet-V2Evaluation Protocol=Baseline2019.06 | 95 | |
| OURSShots=4, Backbone=ViT-B/16, Templates=72025.12 | 94.9 | |
| OURSShots=4, Backbone=ViT-B/16, Templates=12025.12 | 94.8 | |
| SUPEvaluation Protocol=Linear evaluation, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 94.7 | |
| DINOBackbone=ViT-B/16, Pre-training Epochs=400, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 94.6 | |
| RényiCLEvaluation Protocol=linear evaluation, Multi-crop Augmentation=false2022.08 | 94.2 | |
| iBOTBackbone=ViT-L/16, Pre-training Epochs=250, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 94 | |
| LoRA-CLIPShots=4, Backbone=ViT-B/16, Templates=72025.12 | 93.9 | |
| C-RADIOv3Encoder=ViT-B, Dimension=32, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 93.7 | |
| LoRA-CLIPShots=4, Backbone=ViT-B/16, Templates=12025.12 | 93.7 | |
| iBOTBackbone=ViT-B/16, Pre-training Epochs=400, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 93.7 | |
| TWISTEvaluation Protocol=Linear evaluation, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 93.4 | |
| ViT-BAdaptation Strategy=Fine-tuning, Params=85.8M, Pre-training Dataset=ImageNet-1K2026.05 | 92.9 | |
| bViT-BAdaptation Strategy=LoRA, FFN, Params=62K, Pre-training Dataset=ImageNet-1K2026.05 | 92.6 | |
| bViT-BAdaptation Strategy=Fine-tuning, Params=7.8M, Pre-training Dataset=ImageNet-1K2026.05 | 92.3 | |
| VISRegBackbone=ViT-L/14, Pre-training Epochs=100, Training Heuristics=w/o heuristics, Linear Probe Training Epochs=1002026.06 | 92.3 | |
| RandomEvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 92 | |
| ViT-BAdaptation Strategy=LoRA, QV, Params=296K, Pre-training Dataset=ImageNet-1K2026.05 | 91.9 | |
| ViT-BAdaptation Strategy=LoRA, FFN, Params=738K, Pre-training Dataset=ImageNet-1K2026.05 | 91.8 | |
| bViT-BAdaptation Strategy=LoRA, QV, Params=25K, Pre-training Dataset=ImageNet-1K2026.05 | 91.7 | |
| MoCoV3Backbone=ViT-B/16, Pre-training Epochs=300, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 91.5 | |
| SimCLREvaluation Protocol=Linear evaluation, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 91.2 | |
| InfoMinEvaluation Protocol=linear evaluation, Multi-crop Augmentation=false2022.08 | 91.2 | |
| CLSAEvaluation Protocol=linear evaluation, Multi-crop Augmentation=true2022.08 | 91.2 | |
| LeJEPA*Backbone=ViT-L/14, Pre-training Epochs=100, Training Heuristics=w/o heuristics, Linear Probe Training Epochs=1002026.06 | 91.2 | |
| bViT-BAdaptation Strategy=Time embedding tuning, Params=9K, Pre-training Dataset=ImageNet-1K2026.05 | 91.1 | |
| CLSAEvaluation Protocol=linear evaluation, Multi-crop Augmentation=false2022.08 | 90.8 | |
| VISRegBackbone=ViT-B/16, Pre-training Epochs=400, Training Heuristics=w/o heuristics, Linear Probe Training Epochs=102026.06 | 90.4 | |
| VISRegBackbone=ViT-L/14, Pre-training Epochs=400, Training Heuristics=w/o heuristics, Linear Probe Training Epochs=102026.06 | 90.2 | |
| ViT-B/16#Params=86M2022.04 | 89.5 | |
| CoCoOpShots=162024.07 | 87.84 | |
| VP (white-box)Shots=16, Model Access Type=White-box2024.07 | 86.9 | |
| I-JEPABackbone=ViT-H/14, Pre-training Epochs=300, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 86.8 | |
| DINOv3Encoder=ViT-B, Dimension=16, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 86.7 | |
| bViT-BAdaptation Strategy=Linear probing, Params=—, Pre-training Dataset=ImageNet-1K2026.05 | 86.7 | |
| AWTShots=12024.07 | 85.61 | |
| ViT-B/32#Params=86M2022.04 | 85.4 | |
| MAEBackbone=ViT-L/16, Pre-training Epochs=1600, Training Heuristics=w/o heuristics, Linear Probe Training Epochs=102026.06 | 85.4 | |
| LoRA-CLIPShots=1, Backbone=ViT-B/16, Templates=72025.12 | 83.7 | |
| OURSShots=1, Backbone=ViT-B/16, Templates=12025.12 | 83.3 | |
| LoRA-CLIPShots=1, Backbone=ViT-B/16, Templates=12025.12 | 83.2 | |
| ViT-BAdaptation Strategy=Linear probing, Params=—, Pre-training Dataset=ImageNet-1K2026.05 | 83 | |
| OURSShots=1, Backbone=ViT-B/16, Templates=72025.12 | 82.8 | |
| data2vecBackbone=ViT-L/14, Pre-training Epochs=1600, Training Heuristics=w/ heuristics, Linear Probe Training Epochs=102026.06 | 81.4 | |
| CoOpShots=12024.07 | 77.53 | |
| CoCoOpShots=12024.07 | 72.08 | |
| BlackVIP-SEShots=16, Model Access Type=Black-box2024.07 | 71.5 | |
| ZSEvaluation Protocol=Zero-shot2024.07 | 71.3 | |
| BARShots=16, Model Access Type=Black-box2024.07 | 71.2 | |
| BlackVIPShots=16, Model Access Type=Black-box2024.07 | 70.6 | |
| Handcrafted2024.07 | 67.44 | |
| VP w/ SPSA-GCShots=16, Model Access Type=Black-box2024.07 | 67 | |
| DINOv3Encoder=ViT-B, Dimension=8, Compression=PCA, Evaluation Protocol=Linear probing2026.01 | 57.8 |