Image Classification on Food-101
99.3AccuracyAG-Net
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AG-Net2021.10 | 99.3 | — | — | 99.87 | — | — | — | — | — | — | — | — | — | — | |
| MetaCLIP+ViSE2026.02 | 97.012 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Only ViSE2026.02 | 97.012 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP2-g-optSize=g2026.02 | 97 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PEcore GSize=G2026.02 | 96.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PEcore G (image only)Size=G, Input=image only2026.02 | 96.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HIVEFoundation Model=SigLIP2026.03 | 96.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseFoundation Model=SigLIP2026.03 | 96.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAFoundation Model=SigLIP2026.03 | 96.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2Architecture=ViT-g/14, Pre-training Data=LVD, Resolution=518x518, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 96.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KD 2B to ViT-H, M+V+L4Backbone=ViT-H, Distillation=KD 2B, Target=M+V+L42026.02 | 96.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KD 2B to ViT-H, ViseBackbone=ViT-H, Distillation=KD 2B, Target=Vise2026.02 | 96.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PEcore LSize=L2026.02 | 96.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DFN-H+2026.02 | 96.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP2-L/16Backbone=SigLIP2-L, Patch Size=162026.02 | 96.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 95.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 95.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVA 18BSize=18B2026.02 | 95.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HIVEFoundation Model=CLIP2026.03 | 95.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAFoundation Model=CLIP2026.03 | 95.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseFoundation Model=CLIP2026.03 | 95.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-L/16Backbone=SigLIP-L, Patch Size=162026.02 | 95.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JFT - Adaptive TransferBackbone=AmoebaNet-B2018.11 | 95.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Dom-AdBackbone=AmoebaNet-B2020.09 | 95.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-C2026.02 | 95.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear ProbeBackbone=CLIP ViT-L/142024.06 | 95.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP L/14Backbone Scale=L/14, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 95.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JFT - FoodBackbone=AmoebaNet-B2018.11 | 95.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BASIC-LBackbone=BASIC-L2021.11 | 95.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 95 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear ProbeBackbone=DINOv2 ViT-g/142024.06 | 94.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP* L/14Backbone Scale=L/14, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 94.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-B/16, Pre-training Data=RedCaps, Protocol=5-way 5-shot2023.05 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPPre-training dataset=RedCaps, Pre-training data source=Real, Evaluation protocol=Few-shot2023.06 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JFT - Adaptive TransferPre-training Source=JFT, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Dom-AdBackbone=Inception-v32020.09 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AIM-7B†Architecture=ViT-7B/14, Pre-training Data=DFN-2B+, Feature Extraction Layer=20th, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-L/14-3362021.11 | 93.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CapPa L/14Backbone Scale=L/14, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 93.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPFT + ABackbone=ViT-B/32, Evaluation Protocol=Zero-shot, Text Prompting Strategy=LLM attributes, Training Approach=Fine-tuned2024.01 | 93.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JFT - FoodPre-training Source=JFT, Subset=Food, Backbone=Inception v3, Evaluation Protocol=Fine-tuning2018.11 | 93.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 93.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| iBOTArchitecture=ViT-L/16, Pre-training Data=IN-21k, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEArchitecture=ViT-2B/14, Pre-training Data=IG-3B, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP + PACLVision Encoder=ViT-L/14, zero-shot evaluation=true2022.12 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Linear ProbeBackbone=CLIP ViT-L/142025.11 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullBackbone=ResNet-50, Pre-training=JFT, Protocol=Full2020.09 | 93.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AIM-7BArchitecture=ViT-7B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 93.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Best Published Result [14]Backbone=AmoebaNet-B, Input Resolution=480 x 4802018.11 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPipeNumber of Parameters=556M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B7Number of Parameters=64M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPipe2021.10 | 93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PS-CBMBackbone=CLIP ViT-L/142025.11 | 93 | — | — | — | — | — | — | — | — | 71.1 | — | — | — | — | |
| DINOv2Arch.=ViT-L*, SSL Type Target=GL+DE, SSL Type Method=DIST+MIM, Evaluation Protocol=linear probing2026.02 | 92.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP*Image Encoder=ViT-B/16, Pretrain Dataset Size=400M, Evaluation Protocol=Linear probe2022.04 | 92.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 92.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLG-CBMBackbone=CLIP ViT-L/142025.11 | 92.8 | — | — | — | — | — | — | — | — | 68.6 | — | — | — | — | |
| SigLIP2-B/16Backbone=SigLIP2-B, Patch Size=162026.02 | 92.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenCLIP VIT-H/14zero-shot=true2023.03 | 92.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AIM-3BArchitecture=ViT-3B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 92.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPVision Encoder=ViT-L/14, zero-shot evaluation=true2022.12 | 92.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone Scale=B/16, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 92.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPArchitecture=ViT-B/32, Pre-training Data=LAION-400M, Protocol=5-way 5-shot2023.05 | 92.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PEcore BSize=B2026.02 | 92.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaBoBackbone=CLIP ViT-L/142025.11 | 92.4 | — | — | — | — | — | — | — | — | 63.9 | — | — | — | — | |
| JFT - AnimalBackbone=AmoebaNet-B2018.11 | 92.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BASIC-MBackbone=BASIC-M2021.11 | 92.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TURTLEBackbone=DINOv2 + CLIP ViT-L/14, Setting=2-spaces2024.06 | 92.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LM4CVBackbone=CLIP ViT-L/142025.11 | 92.2 | — | — | — | — | — | — | — | — | 68.9 | — | — | — | — | |
| DN-CBMBackbone=CLIP ViT-L/142025.11 | 92.2 | — | — | — | — | — | — | — | — | 63.4 | — | — | — | — | |
| V2C-CBMBackbone=CLIP ViT-L/142025.11 | 92.2 | — | — | — | — | — | — | — | — | 63.7 | — | — | — | — | |
| OriginalBackbone=ViT-L/14, Step=Step 02026.05 | 92.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Entire JFT DatasetBackbone=AmoebaNet-B2018.11 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DCBMBackbone=CLIP ViT-L/142025.11 | 92 | — | — | — | — | — | — | — | — | 65.4 | — | — | — | — | |
| CLIP* (16k)Backbone Scale=B/16, Pre-training Batch Size=16k, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-LBackbone=DeiT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LF-CBMBackbone=CLIP ViT-L/142025.11 | 91.8 | — | — | — | — | — | — | — | — | 69.5 | — | — | — | — | |
| StableRepPre-training dataset=RedCaps, Pre-training data source=Syn, Evaluation protocol=Few-shot2023.06 | 91.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CATABackbone=ViT-L/14, Step=Step 52026.05 | 91.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ImageNet - Entire DatasetBackbone=AmoebaNet-B2018.11 | 91.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaptersBackbone=ResNet-50, Pre-training=JFT, Protocol=Adapters2020.09 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AIM-1BArchitecture=ViT-1B/14, Pre-training Data=DFN-2B+, Evaluation Protocol=Attentive Probing, Backbone State=Frozen2024.01 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP-B/16Backbone=SigLIP-B, Patch Size=162026.02 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GABackbone=ViT-L/14, Step=Step 52026.05 | 91.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPEvaluation protocol=Zero-shot2024.07 | 91.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ImageNet - Adaptive TransferBackbone=AmoebaNet-B2018.11 | 91.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientNet-B4Number of Parameters=17M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 91.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineBackbone=ResNet-502020.09 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-LBackbone=ViT-L, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HUVREncoder=ViT-L, Dimension=32, Compression=HUVR, Evaluation Protocol=Linear probing2026.01 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP* (8k)Backbone Scale=B/16, Pre-training Batch Size=8k, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT-BBackbone=DeiT-B, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-SBackbone=Swin-S, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin-SBackbone=Swin-S, ForAug=false, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 91.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch.=ViT-B*, SSL Type Target=GL+DE, SSL Type Method=DIST+MIM, Evaluation Protocol=linear probing2026.02 | 91.08 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CapPaBackbone Scale=B/16, Pre-training Batch Size=8k, Evaluation Protocol=Frozen visual representations with single transformer decoder2023.06 | 90.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViT-BBackbone=ViT-B, ForAug=true, Pre-training Dataset=ImageNet, Evaluation Protocol=Finetuning2025.03 | 90.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Inception-v4Number of Parameters=41M, Pre-training=ImageNet, Transfer Learning=true2019.05 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Procedural warm-upBackbone=ViT-B, Pre-training=ImageNet-1K, Initialization/Warm-up=Procedural warm-up (ours), Evaluation Protocol=Fine-tuned2025.11 | 90.79 | — | — | — | — | — | — | — | — | — | — | — | — | — |