Image Classification on Oxford-IIIT Pets
97.9AccuracyBASIC-L
Evaluation Results
| Method | Links | |
|---|---|---|
| BASIC-LBackbone=BASIC-L2021.11 | 97.9 | |
| SoViT-400m/14N-shot=10, Probe=linear regression2023.05 | 97.6 | |
| ViT-g/14N-shot=10, Probe=linear regression2023.05 | 97.4 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 97.1 | |
| ViT-L/16N-shot=10, Probe=linear regression2023.05 | 97 | |
| StatABackbone=ViT-L/14, Scenario=High, Batch Size=1282025.01 | 96.5 | |
| StatABackbone=ViT-L/14, Batch Size=128, Online Test-Time Adaptation=true, Scenario=High2025.01 | 96.5 | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 96.4 | |
| StatABackbone=ViT-L/14, Scenario=Medium, Batch Size=1282025.01 | 96.3 | |
| StatABackbone=ViT-L/14, Scenario=Separate, Batch Size=1282025.01 | 96.3 | |
| StatABackbone=ViT-L/14, Batch Size=128, Online Test-Time Adaptation=true, Scenario=Medium2025.01 | 96.3 | |
| StatABackbone=ViT-L/14, Batch Size=128, Online Test-Time Adaptation=true, Scenario=Separate2025.01 | 96.3 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 96.2 | |
| GPipeNumber of Parameters=556M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 95.9 | |
| Florence-CoSwin-HBackbone=CoSwin-H, Resolution=384px, Evaluation Protocol=Zero-shot2021.11 | 95.9 | |
| AmoebaNet-B (6,512)2019.06 | 95.9 | |
| EVA-02-CLIP-E/14+zero-shot evaluation protocol=true2023.03 | 95.8 | |
| LaCLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 95.7 | |
| Mini-DeiT-B↑384#Params=44M2022.04 | 95.5 | |
| EfficientNet-B6Number of Parameters=41M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 95.4 | |
| EfficientNet-B7# Params=64.0M, # FLOPs=37.2B, Resolution=600, Pre-training=ImageNet, Fine-tuning=true2021.07 | 95.4 | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 95.4 | |
| BASIC-MBackbone=BASIC-M2021.11 | 95.3 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 95.3 | |
| CMT-S# Params=25.1M, # FLOPs=4.04B, Pre-training=ImageNet, Fine-tuning=true2021.07 | 95.2 | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 95.1 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 95.1 | |
| ViT-BBackbone=ViT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 95.1 | |
| ViT-LBackbone=ViT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 95.1 | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 95 | |
| StatABackbone=ViT-L/14, Scenario=Low, Batch Size=1282025.01 | 95 | |
| StatABackbone=ViT-L/14, Batch Size=128, Online Test-Time Adaptation=true, Scenario=Low2025.01 | 95 | |
| TGR-MoEModel Size=Base, Top-K Routing=22026.04 | 94.97 | |
| CeiT-SFLOPs=12.9G, Resolution=384x384, Pre-training=ImageNet2021.03 | 94.9 | |
| CeiT-S# Params=24.2M, # FLOPs=12.9B, Resolution=384, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.9 | |
| CLIP+Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 94.9 | |
| Swin-SBackbone=Swin-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.9 | |
| EfficientNet-B4Number of Parameters=17M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 94.8 | |
| FixResBackbone=SENet-1542019.06 | 94.8 | |
| Swin-TiBackbone=Swin-Ti, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.8 | |
| TNT-S# Params=23.8M, # FLOPs=17.3B, Resolution=384, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.7 | |
| OURSShots=8, Backbone=ViT-B/16, Templates=72025.12 | 94.7 | |
| Full Fine-tuningBackbone=ViT-L/16, Pre-trained=ImageNet12K2026.04 | 94.67 | |
| TGR-MoEModel Size=Base, Top-K Routing=12026.04 | 94.63 | |
| OpenCLIP ViT-H/14Zero-shot=true, Backbone=ViT-H/14, Confidence Interval=95% CI, Runs=52025.10 | 94.61 | |
| CeiT-SFLOPs=4.5G, Resolution=224x224, Pre-training=ImageNet2021.03 | 94.6 | |
| SENet-154Evaluation Protocol=Baseline2019.06 | 94.6 | |
| OpenCLIP VIT-H/14zero-shot=true2023.03 | 94.6 | |
| ResNet-152Number of Parameters=58M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 94.5 | |
| CeiT-TFLOPs=3.6G, Resolution=384x384, Pre-training=ImageNet2021.03 | 94.5 | |
| TWISTEvaluation Protocol=Fine-tune, Backbone=ResNet-50, Pre-trained=ImageNet2021.10 | 94.5 | |
| ResNet-152# Params=58.1M, # FLOPs=11.3B, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.5 | |
| CLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 94.5 | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 94.5 | |
| ViT-SBackbone=ViT-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.5 | |
| Swin-SBackbone=Swin-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.4 | |
| ResNet-101Backbone=ResNet-101, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.3 | |
| VMoE w/ z-lossModel Size=Base, Top-K Routing=12026.04 | 94.21 | |
| ViTAE-SParams (M)=23.62022.02 | 94.2 | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 94.2 | |
| OURSShots=8, Backbone=ViT-B/16, Templates=12025.12 | 94.2 | |
| ViT-LBackbone=ViT-L, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.2 | |
| Swin-TiBackbone=Swin-Ti, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.2 | |
| TGR-MoEModel Size=Small, Top-K Routing=22026.04 | 94.14 | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 94.1 | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 94.1 | |
| ViT-BBackbone=ViT-B, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94.1 | |
| BaLoRABackbone=ViT-L/16, Pre-trained=ImageNet12K2026.04 | 94.07 | |
| SAM + GAMBackbone=Swin-t, Evaluation Protocol=finetuning2023.03 | 94.03 | |
| DoRABackbone=ViT-L/16, Pre-trained=ImageNet12K2026.04 | 94.01 | |
| Skip TuningShot=16, Time (s)=962, Mem. (M)=5282024.12 | 94 | |
| ResNet-101Backbone=ResNet-101, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 94 | |
| CRATE-αModel variant=L/142024.05 | 93.98 | |
| LoRABackbone=ViT-L/16, Pre-trained=ImageNet12K2026.04 | 93.96 | |
| AdamW + GAMBackbone=Swin-t, Evaluation Protocol=finetuning2023.03 | 93.87 | |
| ViT-B/16FLOPs=18.7G, Pre-training=ImageNet2021.03 | 93.8 | |
| CeiT-TFLOPs=1.2G, Resolution=224x224, Pre-training=ImageNet2021.03 | 93.8 | |
| ViT-B/16#Params=86M2022.04 | 93.8 | |
| ViT-B/16# Params=85.8M, # FLOPs=17.6B, Resolution=384, Pre-training=ImageNet, Fine-tuning=true2021.07 | 93.8 | |
| ViT-B/16Params (M)=86.52022.02 | 93.8 | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.8 | |
| ViT-SBackbone=ViT-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.8 | |
| TGR-MoEModel Size=Small, Top-K Routing=12026.04 | 93.79 | |
| VMoEModel Size=Base, Top-K Routing=12026.04 | 93.79 | |
| Inception-v4# Params=41.1M, # FLOPs=16.1B, Pre-training=ImageNet, Fine-tuning=true2021.07 | 93.7 | |
| OURSShots=4, Backbone=ViT-B/16, Templates=12025.12 | 93.7 | |
| ResNet-50Backbone=ResNet-50, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.7 | |
| ResNet-50Backbone=ResNet-50, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.7 | |
| Expert Choice MoEModel Size=Small, Top-K Routing=12026.04 | 93.69 | |
| ProSRCShot=16, Time (s)=14403, Mem. (M)=33732024.12 | 93.67 | |
| ViT (dense)Model Size=Base, Top-K Routing=12026.04 | 93.65 | |
| ViT-L/16FLOPs=65.8G, Pre-training=ImageNet2021.03 | 93.6 | |
| ViT-L/16Params (M)=304.32022.02 | 93.6 | |
| SAMBackbone=Swin-t, Evaluation Protocol=finetuning2023.03 | 93.59 | |
| CLIP-ViT-L/14Backbone=ViT-L/14, Resolution=336px, Evaluation Protocol=Zero-shot2021.11 | 93.5 | |
| CLIPBackbone=ViT-L/14-3362021.11 | 93.5 | |
| CLIPBackbone=ViT-L/14, Setting=Zero-shot, Batch Size=1282025.01 | 93.5 | |
| CLIPBackbone=ViT-L/14, Batch Size=128, Online Test-Time Adaptation=false2025.01 | 93.5 | |
| ProSRCShot=8, Time (s)=7636, Mem. (M)=33732024.12 | 93.5 | |
| OURSShots=4, Backbone=ViT-B/16, Templates=72025.12 | 93.5 |