Image Classification on Stanford Cars
99.5AccuracyLaCLIP
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 99.5 | — | — | — | — | — | — | — | — | |
| SARELearning Paradigm=Training-based2026.03 | 99.34 | — | — | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 99.2 | — | — | — | — | — | — | — | — | |
| LaCLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 99.1 | — | — | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 98.5 | — | — | — | — | — | — | — | — | |
| JFT - CarBackbone=AmoebaNet-B2018.11 | 96.2 | — | — | — | — | — | — | — | — | |
| FullBackbone=ResNet-50, Pre-training=JFT, Protocol=Full2020.09 | 96.1 | — | — | — | — | — | — | — | — | |
| JFT - CarPre-training Source=JFT, Subset=Car, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 96 | — | — | — | — | — | — | — | — | |
| JFT - VehicleBackbone=AmoebaNet-B2018.11 | 96 | — | — | — | — | — | — | — | — | |
| TResNet-LSpeed (img/sec)=500, Input resolution=368, Precision=Mixed Precision V100 GPU2020.03 | 96 | — | — | — | — | — | — | — | — | |
| DFN-H+2026.02 | 96 | — | — | — | — | — | — | — | — | |
| Open-TransMindBackbone=vit-huge, Type=multi, Tasks=cls, det, seg2023.04 | 95.96 | — | — | — | — | — | — | — | — | |
| JFT - TransportPre-training Source=JFT, Subset=Transport, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 95.9 | — | — | — | — | — | — | — | — | |
| JFT - TransportBackbone=AmoebaNet-B2018.11 | 95.9 | — | — | — | — | — | — | — | — | |
| AdaptersBackbone=ResNet-50, Pre-training=JFT, Protocol=Adapters2020.09 | 95.9 | — | — | — | — | — | — | — | — | |
| SigLIP2-g-optSize=g2026.02 | 95.9 | — | — | — | — | — | — | — | — | |
| Open-TransMindBackbone=vit-huge, Type=single, Tasks=cls2023.04 | 95.85 | — | — | — | — | — | — | — | — | |
| JFT - VehiclePre-training Source=JFT, Subset=Vehicle, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 95.8 | — | — | — | — | — | — | — | — | |
| JFT - Adaptive TransferBackbone=AmoebaNet-B2018.11 | 95.8 | — | — | — | — | — | — | — | — | |
| Dom-AdBackbone=AmoebaNet-B2020.09 | 95.8 | — | — | — | — | — | — | — | — | |
| SigLIP2-L/16Backbone=SigLIP2-L, Patch Size=162026.02 | 95.8 | — | — | — | — | — | — | — | — | |
| JFT - Adaptive TransferPre-training Source=JFT, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 95.7 | — | — | — | — | — | — | — | — | |
| Dom-AdBackbone=Inception-v32020.09 | 95.7 | — | — | — | — | — | — | — | — | |
| CAPBackbone=Xception, Pretrain=ImageNet-1k2022.03 | 95.7 | — | — | — | — | — | — | — | — | |
| CAPBackbone=xception, Type=single, Tasks=cls2023.04 | 95.7 | — | — | — | — | — | — | — | — | |
| BaselineBackbone=ResNet-502020.09 | 95.6 | — | — | — | — | — | — | — | — | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 95.6 | — | — | — | — | — | — | — | — | |
| Entire JFT DatasetBackbone=AmoebaNet-B2018.11 | 95.3 | — | — | — | — | — | — | — | — | |
| API-NetBackbone=DenseNet-161, Pretrain=ImageNet-1k2022.03 | 95.3 | — | — | — | — | — | — | — | — | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=CC12M, Protocol=5-way 5-shot2023.05 | 95.3 | — | — | — | — | — | — | — | — | |
| PMGBackbone=ResNet-50, Pretrain=ImageNet-1k2022.03 | 95.1 | — | — | — | — | — | — | — | — | |
| MetaFormerBackbone=MetaFormer-1, Pretrain=ImageNet-21k2022.03 | 95 | — | — | — | — | — | — | — | — | |
| MetaFormerBackbone=MetaFormer-1, Pretrain=iNat212022.03 | 95 | — | — | — | — | — | — | — | — | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 95 | — | — | — | — | — | — | — | — | |
| MetaFormerBackbone=MetaFormer-1, Pretrain=ImageNet-1k2022.03 | 94.9 | — | — | — | — | — | — | — | — | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 94.9 | — | — | — | — | — | — | — | — | |
| EVA 18BSize=18B2026.02 | 94.9 | — | — | — | — | — | — | — | — | |
| DATDomain Adaptive Transfer Learning=true2019.05 | 94.8 | — | — | — | — | — | — | — | — | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 94.8 | — | — | — | — | — | — | — | — | |
| SigLIP-L/16Backbone=SigLIP-L, Patch Size=162026.02 | 94.8 | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Speed (img/sec)=70, Input resolution=600, Precision=Mixed Precision V100 GPU2020.03 | 94.7 | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Number of Parameters=64M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 94.7 | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Pre-training=ImageNet-1k, Resolution=600x600, Number of Parameters=64M2020.11 | 94.7 | — | — | — | — | — | — | — | — | |
| GrafitBackbone=RegNetY-8.0GF, Pre-training=ImageNet-1k, Resolution=384x384, Number of Parameters=39M, Classifier=MLP2020.11 | 94.7 | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Resolution=224, Crop-ratio=0.8752021.03 | 94.7 | — | — | — | — | — | — | — | — | |
| S3NBackbone=ResNet-50, Pretrain=ImageNet-1k2022.03 | 94.7 | — | — | — | — | — | — | — | — | |
| EfficientNet-B7# Params=64.0M, # FLOPs=37.2B, Resolution=600, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.7 | — | — | — | — | — | — | — | — | |
| PEcore GSize=G2026.02 | 94.7 | — | — | — | — | — | — | — | — | |
| Best Published Result [14]Backbone=AmoebaNet-B, Input Resolution=480 x 4802018.11 | 94.6 | — | — | — | — | — | — | — | — | |
| GPipeBackbone=AmoebaNet-B, Pretrain=ImageNet-1k2022.03 | 94.6 | — | — | — | — | — | — | — | — | |
| UNICOMPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 94.6 | — | — | — | — | — | — | — | — | |
| PEcore G (image only)Size=G, Input=image only2026.02 | 94.6 | — | — | — | — | — | — | — | — | |
| UniFGVCLearning Paradigm=Training-free, Method Strategy=Reasoning-based2026.03 | 94.6 | — | — | — | — | — | — | — | — | |
| DCLBackbone=ResNet-50, Pretrain=ImageNet-1k2022.03 | 94.5 | — | — | — | — | — | — | — | — | |
| CMT-S# Params=25.1M, # FLOPs=4.04B, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.4 | — | — | — | — | — | — | — | — | |
| InternVL-C2026.02 | 94.4 | — | — | — | — | — | — | — | — | |
| Fine-TunedBackbone=DINOv3 ViT-B/162025.12 | 94.4 | — | — | — | — | — | — | — | — | |
| iBOTBackbone=ViT-B/162022.03 | 94.3 | — | — | — | — | — | — | — | — | |
| iBOTBackbone=ViT-B, Evaluation Protocol=fine-tuning2022.09 | 94.3 | — | — | — | — | — | — | — | — | |
| ImageNet - Entire DatasetBackbone=AmoebaNet-B2018.11 | 94.2 | — | — | — | — | — | — | — | — | |
| CaiT-M-36 ↑ 224Resolution=224, Crop-ratio=0.875, Training=Longer schedules2021.03 | 94.2 | — | — | — | — | — | — | — | — | |
| BEITBackbone=ViT-B/162022.03 | 94.2 | — | — | — | — | — | — | — | — | |
| CaiT-S-36 ↑ 224Resolution=224, Crop-ratio=0.875, Training=Longer schedules2021.03 | 94.1 | — | — | — | — | — | — | — | — | |
| CeiT-S# Params=24.2M, # FLOPs=12.9B, Resolution=384, Pre-training=ImageNet, Fine-tuning=true2021.07 | 94.1 | — | — | — | — | — | — | — | — | |
| Entire JFT DatasetPre-training Source=JFT, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 94 | — | — | — | — | — | — | — | — | |
| iBOTBackbone=ViT-S/162022.03 | 94 | — | — | — | — | — | — | — | — | |
| MugsBackbone=ViT-B/162022.03 | 94 | — | — | — | — | — | — | — | — | |
| MugsBackbone=ViT-S/162022.03 | 93.9 | — | — | — | — | — | — | — | — | |
| ViT-g/14N-shot=10, Probe=linear regression2023.05 | 93.9 | — | — | — | — | — | — | — | — | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.9 | — | — | — | — | — | — | — | — | |
| ViT-L/16N-shot=10, Probe=linear regression2023.05 | 93.8 | — | — | — | — | — | — | — | — | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.8 | — | — | — | — | — | — | — | — | |
| Linear ProbeBackbone=DINOv3 ViT-B/162025.12 | 93.8 | — | — | — | — | — | — | — | — | |
| DeiT-LBackbone=DeiT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.8 | — | — | — | — | — | — | — | — | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 93.71 | — | — | — | — | — | — | — | — | |
| dBOTBackbone=ViT-B, Evaluation Protocol=fine-tuning2022.09 | 93.7 | — | — | — | — | — | — | — | — | |
| MAEArchitecture=ViT-H/14, Pre-training Data=IN-1k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.7 | — | — | — | — | — | — | — | — | |
| PEcore LSize=L2026.02 | 93.7 | — | — | — | — | — | — | — | — | |
| Task MatrixBackbone=DINOv3 ViT-B/16, best layer=112025.12 | 93.7 | — | — | — | — | — | — | — | — | |
| EfficientNet-B3Number of Parameters=10M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 93.6 | — | — | — | — | — | — | — | — | |
| SoViT-400m/14N-shot=10, Probe=linear regression2023.05 | 93.6 | — | — | — | — | — | — | — | — | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Linear Probe2024.07 | 93.6 | — | — | — | — | — | — | — | — | |
| ImageNet - Adaptive TransferBackbone=AmoebaNet-B2018.11 | 93.5 | — | — | — | — | — | — | — | — | |
| CaiT-S-36 224Resolution=224, Crop-ratio=0.8752021.03 | 93.5 | — | — | — | — | — | — | — | — | |
| CaiT-M-36 224Resolution=224, Crop-ratio=0.8752021.03 | 93.5 | — | — | — | — | — | — | — | — | |
| ISyNet-N32021.09 | 93.46 | — | — | — | — | — | — | — | — | |
| Inception-v4Number of Parameters=41M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 93.4 | — | — | — | — | — | — | — | — | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 93.4 | — | — | — | — | — | — | — | — | |
| Open-TransMindBackbone=vit-base, Type=task-moe, Tasks=cls, det, seg2023.04 | 93.34 | — | — | — | — | — | — | — | — | |
| JFT - AircraftBackbone=AmoebaNet-B2018.11 | 93.3 | — | — | — | — | — | — | — | — | |
| Inception-v4# Params=41.1M, # FLOPs=16.1B, Pre-training=ImageNet, Fine-tuning=true2021.07 | 93.3 | — | — | — | — | — | — | — | — | |
| ViT-BBackbone=ViT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.3 | — | — | — | — | — | — | — | — | |
| JFT - AnimalBackbone=AmoebaNet-B2018.11 | 93.2 | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.1 | — | — | — | — | — | — | — | — | |
| Swin-SBackbone=Swin-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 93.1 | — | — | — | — | — | — | — | — | |
| DINOBackbone=ViT-S/162022.03 | 93 | — | — | — | — | — | — | — | — | |
| DINOBackbone=ViT-B/162022.03 | 93 | — | — | — | — | — | — | — | — | |
| DINOBackbone=ViT-B, Evaluation Protocol=fine-tuning2022.09 | 93 | — | — | — | — | — | — | — | — | |
| AIM-0.6BArchitecture=ViT-H/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93 | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 92.9 | — | — | — | — | — | — | — | — |