Image Classification on ImageNet-ReaL
91.24Precision@1Best model on each test set (oracle)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Best model on each test set (oracle)Backbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=oracle (best on test set)2022.03 | 91.24 | — | |
| ViT-G/14 greedy soupBackbone=ViT/G-14, Model Selection Strategy=greedy soup2022.03 | 91.2 | — | |
| Classic Specialist (Non-VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 91.2 | — | |
| Meta Pseudo Labels (EfficientNet-B6-Wide)# Params=390M, Extra Data=300M unlabeled JFT2020.03 | 91.12 | — | |
| Greedy ensembleBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=greedy ensemble2022.03 | 91.11 | — | |
| LionModel=ViT-g/14, Input Resolution=518x518, #Params=1.04B, Pre-training Dataset=JFT-3B2023.02 | 91.11 | — | |
| ViT-e/14Evaluation Protocol=High-res fine-tuning2023.02 | 91.1 | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-6.5B, Resolution=5182023.03 | 91.1 | — | |
| Classic Specialist (VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 91.1 | — | |
| LionModel=ViT-G/14, Input Resolution=518x518, #Params=1.88B, Pre-training Dataset=JFT-3B2023.02 | 91.06 | 91.25 | |
| Greedy soupBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=greedy soup2022.03 | 91.03 | — | |
| Meta Pseudo Labels (EfficientNet-L2)# Params=480M, Extra Data=300M unlabeled JFT2020.03 | 91.02 | — | |
| LionModel=ViT-H/14, Input Resolution=518x518, #Params=633.47M, Pre-training Dataset=JFT-300M2023.02 | 91.02 | — | |
| ViT-22BEvaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 90.94 | — | |
| LionModel=ViT-L/16, Input Resolution=512x512, #Params=305.18M, Pre-training Dataset=JFT-300M2023.02 | 90.91 | — | |
| FixNoisy-L2Evaluation Protocol=High-res fine-tuning2023.02 | 90.9 | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-2B, Resolution=5182023.03 | 90.9 | — | |
| Dehghani et al.ViT=22B/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 90.9 | — | |
| Best model on held out val setBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=best on val set2022.03 | 90.84 | — | |
| AdafactorModel=ViT-g/14, Input Resolution=518x518, #Params=1.04B, Pre-training Dataset=JFT-3B2023.02 | 90.84 | — | |
| ViT/G-14Backbone=ViT/G-142022.03 | 90.81 | — | |
| ViT-G/14Evaluation Protocol=High-res fine-tuning2023.02 | 90.81 | — | |
| AdafactorModel=ViT-G/14, Input Resolution=518x518, #Params=1.88B, Pre-training Dataset=JFT-3B2023.02 | 90.81 | — | |
| ViT G/14Pre-training=JFT 3B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.8 | — | |
| Scale-ViTPre-training Dataset=JFT-3B, Architecture=ViT-G, Resolution=5182023.03 | 90.8 | — | |
| MAWSPre-training Dataset=IG-3B, Architecture=ViT-H, Resolution=5182023.03 | 90.8 | — | |
| ViT-e/14Evaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 90.74 | — | |
| Vision Transformer (ViT-H)# Params=632M, Extra Data=300M labeled JFT2020.03 | 90.72 | — | |
| ViT H/14Pre-training=JFT 300M, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.7 | — | |
| RegNetY 128GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.7 | — | |
| Chen et al.ViT=e/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 90.7 | — | |
| ViT-H/14Optimizer=Lion, Parameters=632.72M, Epochs / Steps=14 / 1,035,583, Fine-tuning resolution=392x392, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 90.68 | — | |
| ViT-L/16Optimizer=Lion, Parameters=304.72M, Epochs / Steps=14 / 1,035,583, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 90.62 | — | |
| AdamWModel=ViT-H/14, Input Resolution=518x518, #Params=633.47M, Pre-training Dataset=JFT-300M2023.02 | 90.62 | — | |
| EfficientNet L2Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.6 | — | |
| ViT L/16Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.6 | — | |
| ViT-G/14Evaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 90.6 | — | |
| Zhai et al.ViT=G/14, Backbone Type=Supervised backbones, Evaluation Protocol=Dehghani et al. (2023) protocol (*)2026.02 | 90.6 | — | |
| Noisy Student (EfficientNet-L2)# Params=480M, Extra Data=300M unlabeled JFT2020.03 | 90.55 | — | |
| Big Transfer (BiT-L)# Params=928M, Extra Data=300M labeled JFT2020.03 | 90.54 | — | |
| ViT L/16Pre-training=JFT 300M, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.5 | — | |
| ViT H/14Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.5 | — | |
| ViT-g/14Evaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 90.5 | — | |
| SWAGPre-training Dataset=IG-3.6B, Architecture=ViT-H, Resolution=5182023.03 | 90.5 | — | |
| SigLIP 2ViT=g/16, Backbone Type=Weakly-supervised backbones2026.02 | 90.5 | — | |
| AdamWModel=ViT-L/16, Input Resolution=512x512, #Params=305.18M, Pre-training Dataset=JFT-300M2023.02 | 90.46 | — | |
| ViT-L/16Optimizer=Lion, Parameters=304.72M, Epochs / Steps=7 / 517,791, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 90.43 | — | |
| ViT L/16Pre-training=JFT 3B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.4 | — | |
| ViT-L/16Evaluation Protocol=High-res fine-tuning2023.02 | 90.4 | — | |
| Scale-ViTPre-training Dataset=JFT-3B, Architecture=ViT-L, Resolution=3842023.03 | 90.4 | — | |
| PEcoreViT=G/14, Backbone Type=Weakly-supervised backbones2026.02 | 90.4 | — | |
| DINOv3ViT=7B/16, Backbone Type=Self-supervised backbones2026.02 | 90.4 | — | |
| AM-RADIOv2.5ViT=g/14, Backbone Type=Agglomerative backbones2026.02 | 90.3 | — | |
| ViT-H/14Optimizer=AdamW, Parameters=632.72M, Epochs / Steps=14 / 1,035,583, Fine-tuning resolution=392x392, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 90.27 | — | |
| RegNetY 32GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.2 | — | |
| DINOv3-LResolution=768, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 90.18 | — | |
| DINOv3-LResolution=256, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 90.12 | — | |
| ViT-L/16Optimizer=AdamW, Parameters=304.72M, Epochs / Steps=14 / 1,035,583, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 90.11 | — | |
| DINOv3-LResolution=384, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 90.11 | — | |
| EfficientNet B7Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.1 | — | |
| DINOv3-LResolution=512, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 90.08 | — | |
| ViT-L/16Evaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 90.05 | — | |
| ViT-L/16Optimizer=AdamW, Parameters=304.72M, Epochs / Steps=7 / 517,791, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 89.95 | — | |
| RegNetY 16GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.9 | — | |
| ViTAEv2-BParams (M)=89.7, FLOPs (G)=24.3, Input Size=224, Pre-training=ImageNet-22k2022.02 | 89.9 | — | |
| DINOv2ViT=g/14, Backbone Type=Self-supervised backbones2026.02 | 89.9 | — | |
| SEERArch.=RG-10B, Pretrain=IG-1B, Param=10B2022.02 | 89.8 | — | |
| EfficientNet B6Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.8 | — | |
| FixRes ResNeXt-101 WSL# Params=829M, Extra Data=3.5B labeled Instagram2020.03 | 89.73 | — | |
| VECA-LResolution=384, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 89.71 | — | |
| AIMv2ViT=3B/14, Backbone Type=Weakly-supervised backbones2026.02 | 89.7 | — | |
| VECA-LResolution=512, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 89.68 | — | |
| EfficientNet B8Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.6 | — | |
| ViT-HMaskSub=true2023.06 | 89.6 | — | |
| VECA-LResolution=768, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 89.53 | — | |
| VECA-LResolution=256, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 89.52 | — | |
| EfficientNet B7Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.5 | — | |
| EVA-CLIPViT=18B/14, Backbone Type=Weakly-supervised backbones2026.02 | 89.5 | — | |
| EfficientNet B6Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.4 | — | |
| SEERArch.=RG-128Gf, Pretrain=IG-1B, Param=693M2022.02 | 89.3 | — | |
| Youtu-VLModel Category=General-Purpose VLM, Model Parameters=4B, Instruct Version=true2026.01 | 89.3 | — | |
| ViTAEv2-BParams (M)=89.7, FLOPs (G)=74.4, Input Size=384, Finetuning Resolution=384x3842022.02 | 89.2 | — | |
| ViT-LMaskSub=true2023.06 | 89.2 | — | |
| ViT-HMaskSub=false2023.06 | 89.2 | — | |
| FrancaViT=g/14, Backbone Type=Self-supervised backbones2026.02 | 89.2 | — | |
| ViT-B/16Optimizer=Lion, Parameters=86.86M, Epochs / Steps=7 / 517,791, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 89.14 | — | |
| ViT B/16Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 89.1 | — | |
| ViT-B/16Optimizer=AdamW, Parameters=86.86M, Epochs / Steps=7 / 517,791, Fine-tuning resolution=384x384, Pre-training=JFT-300M, Polyak averaging=false2023.02 | 89.04 | — | |
| DINOv3-BResolution=512, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 88.95 | — | |
| QUESTModel=ViT-L/16†, Epochs=400 + 20, Training Recipe=DeiT-32026.03 | 88.9 | — | |
| DINOv3-BResolution=384, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 88.9 | — | |
| ViTAEv2-48MParams (M)=48.5, FLOPs (G)=41.1, Input Size=384, Finetuning Resolution=384x3842022.02 | 88.8 | — | |
| ViT-LMaskSub=false2023.06 | 88.8 | — | |
| DINOv3-BResolution=768, Evaluation Protocol=Frozen backbone + Linear head2026.05 | 88.8 | — | |
| ViT-B/16Evaluation Protocol=Linear Probing (frozen), Resolution=224px2023.02 | 88.79 | — | |
| SwAVArch.=RG-128Gf, Pretrain=INet-22k, Param=693M2022.02 | 88.7 | — | |
| ViT H/14Pre-training=IN-21k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.7 | — | |
| ViTAEv2-BParams (M)=89.7, FLOPs (G)=24.3, Input Size=2242022.02 | 88.7 | — | |
| FineViT/14Params=0.86B, Zero-shot=true2026.03 | 88.7 | — | |
| StandardModel=ViT-L/16†, Epochs=400 + 20, Training Recipe=DeiT-32026.03 | 88.7 | — |