Image Classification on ImageNet 1k (test val)
90.94Top-1 AccuracyGreedy soup
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Greedy soupBackbone=ViT-G/14, Pre-training Dataset=JFT-3B, Protocol=Model weight averaging2022.03 | 90.94 | — | |
| CoAtNet-7Backbone=CoAtNet-7, Reference=Dai et al., 20212022.03 | 90.88 | — | |
| Best model in hyperparam searchBackbone=ViT-G/14, Pre-training Dataset=JFT-3B, Protocol=Individual model selection2022.03 | 90.78 | — | |
| ViT-G (reevaluated)Backbone=ViT-G/14, Pre-training Dataset=JFT-3B, Protocol=Fine-tuned2022.03 | 90.47 | — | |
| ViT-GBackbone=ViT-G, Reference=Zhai et al., 20212022.03 | 90.45 | — | |
| Meta-Pseudo-LabelsBackbone=EfficientNet-L2, Resolution=8002021.02 | 90.2 | 98.8 | |
| X-Ray Image EViT-2bEncoder=EViT-2b, Evaluation Protocol=Linear probing2026.02 | 89.3 | 97.37 | |
| PE-GEncoder=PE-G, Evaluation Protocol=Linear probing2026.02 | 89.22 | 98.53 | |
| X-Ray Image (ViSE)Encoder=EViT-2b, Evaluation Protocol=Linear probing, Dataset=ViSE2026.02 | 89.19 | 97.14 | |
| MOAT-4eval size=512x512, params=483.2M, FLOPs=648.5B, training_protocol=22K+1K2022.10 | 89.1 | — | |
| MViTv2-Heval size=512x512, params=667M, FLOPs=763.5B, training_protocol=22K+1K2022.10 | 88.8 | — | |
| MaxViT-XLeval size=512x512, params=475M, FLOPs=535.2B, training_protocol=22K+1K2022.10 | 88.7 | — | |
| ALIGNBackbone=EfficientNet-L2, Evaluation Protocol=fine-tuned, Resolution=6002021.02 | 88.64 | 98.67 | |
| CoAtNet-4eval size=512x512, params=275M, FLOPs=360.9B, training_protocol=22K+1K2022.10 | 88.6 | — | |
| ViTBackbone=ViT-H/142021.02 | 88.55 | — | |
| NoisyStudentBackbone=EfficientNet-L2, Resolution=8002021.02 | 88.4 | 98.7 | |
| MOAT-3eval size=512x512, params=190.0M, FLOPs=271.0B, training_protocol=22K+1K2022.10 | 88.4 | — | |
| MOAT-3eval size=384x384, params=190.0M, FLOPs=141.2B, training_protocol=22K+1K2022.10 | 88.2 | — | |
| DiNO-v3Encoder=7B, Evaluation Protocol=Linear probing2026.02 | 88.1 | — | |
| X-Ray Visual EViT-2bEncoder=EViT-2b, Evaluation Protocol=Linear probing2026.02 | 88.1 | 96.37 | |
| X-Ray ViTL-16Encoder=ViTL-16, Evaluation Protocol=Linear probing2026.02 | 87.94 | 98.51 | |
| ConvNeXt-XLeval size=384x384, params=350M, FLOPs=179.0B, training_protocol=22K+1K2022.10 | 87.8 | — | |
| SwinV2-Leval size=384x384, params=197M, FLOPs=115.4B, training_protocol=22K+1K2022.10 | 87.7 | — | |
| MOAT-2eval size=512x512, params=73.4M, FLOPs=104.6B, training_protocol=22K+1K2022.10 | 87.7 | — | |
| PE-LEncoder=PE-L, Evaluation Protocol=Linear probing2026.02 | 87.64 | 98.53 | |
| CoAtNet-3eval size=384x384, params=168M, FLOPs=107.4B, training_protocol=22K+1K2022.10 | 87.6 | — | |
| BiTBackbone=ResNet152 x 42021.02 | 87.54 | 98.46 | |
| ConvNeXt-Leval size=384x384, params=198M, FLOPs=101.0B, training_protocol=22K+1K2022.10 | 87.5 | — | |
| MOAT-2eval size=384x384, params=73.4M, FLOPs=54.3B, training_protocol=22K+1K2022.10 | 87.5 | — | |
| EfficientNetV2-XLeval size=480x480, params=208M, FLOPs=94B, training_protocol=22K+1K2022.10 | 87.3 | — | |
| Swin-Leval size=384x384, params=197M, FLOPs=103.9B, training_protocol=22K+1K2022.10 | 87.3 | — | |
| MOAT-1eval size=512x512, params=41.6M, FLOPs=58.7B, training_protocol=22K+1K2022.10 | 87.2 | — | |
| MOAT-1eval size=384x384, params=41.6M, FLOPs=29.6B, training_protocol=22K+1K2022.10 | 87 | — | |
| MOAT-3eval size=224x224, params=190.0M, FLOPs=44.9B, training_protocol=22K+1K2022.10 | 86.8 | — | |
| MOAT-3eval size=512x512, params=190.0M, FLOPs=271.0B, training_protocol=1K only2022.10 | 86.7 | — | |
| MOAT-3eval size=384x384, params=190.0M, FLOPs=141.2B, training_protocol=1K only2022.10 | 86.5 | — | |
| MOAT-2eval size=512x512, params=73.4M, FLOPs=104.6B, training_protocol=1K only2022.10 | 86.5 | — | |
| MOAT-2eval size=384x384, params=73.4M, FLOPs=54.3B, training_protocol=1K only2022.10 | 86.2 | — | |
| MOAT-1eval size=512x512, params=41.6M, FLOPs=58.7B, training_protocol=1K only2022.10 | 86.2 | — | |
| MOAT-2eval size=224x224, params=73.4M, FLOPs=17.2B, training_protocol=22K+1K2022.10 | 86 | — | |
| MOAT-1eval size=384x384, params=41.6M, FLOPs=29.6B, training_protocol=1K only2022.10 | 85.9 | — | |
| CoAtNet-3eval size=384x384, params=168M, FLOPs=107.4B, training_protocol=1K only2022.10 | 85.8 | — | |
| EfficientNetV2-Leval size=480x480, params=120M, FLOPs=53B, training_protocol=1K only2022.10 | 85.7 | — | |
| MOAT-0eval size=384x384, params=27.8M, FLOPs=18.2B, training_protocol=22K+1K2022.10 | 85.7 | — | |
| ALIGNBackbone=EfficientNet-L2, Evaluation Protocol=frozen features, Resolution=3602021.02 | 85.5 | — | |
| ConvNeXt-Leval size=384x384, params=198M, FLOPs=101.0B, training_protocol=1K only2022.10 | 85.5 | — | |
| WSLBackbone=ResNeXt-101 32x48d2021.02 | 85.4 | 97.6 | |
| CLIPBackbone=ViT-L/14, Evaluation Protocol=frozen features2021.02 | 85.4 | — | |
| MOAT-3eval size=224x224, params=190.0M, FLOPs=44.9B, training_protocol=1K only2022.10 | 85.3 | — | |
| MOAT-1eval size=224x224, params=41.6M, FLOPs=9.1B, training_protocol=22K+1K2022.10 | 84.9 | — | |
| MOAT-2eval size=224x224, params=73.4M, FLOPs=17.2B, training_protocol=1K only2022.10 | 84.7 | — | |
| MOAT-0eval size=384x384, params=27.8M, FLOPs=18.2B, training_protocol=1K only2022.10 | 84.6 | — | |
| MOAT-1eval size=224x224, params=41.6M, FLOPs=9.1B, training_protocol=1K only2022.10 | 84.2 | — | |
| JFT-300MModel Architecture=ViT-B, Resolution=384^2, Pre-training Type=SL2023.03 | 84.2 | — | |
| ViT-B/16Pretraining=JFT-300M2021.08 | 84.1 | — | |
| PVTv2-B5eval size=224x224, params=82M, FLOPs=11.8B, training_protocol=1K only2022.10 | 83.8 | — | |
| DeiT3-BTeacher=none, #params=87M, Training epochs=3002024.03 | 83.8 | — | |
| VisualAtom-21kModel Architecture=ViT-B, Resolution=384^2, Pre-training Type=FDSL2023.03 | 83.7 | — | |
| MOAT-0eval size=224x224, params=27.8M, FLOPs=5.7B, training_protocol=22K+1K2022.10 | 83.6 | — | |
| ViT-B/16Pretraining=ANN-1.3B2021.08 | 83.6 | — | |
| CaiT-S24Teacher=none, #params=47M, Training epochs=3002024.03 | 83.4 | — | |
| MOAT-0eval size=224x224, params=27.8M, FLOPs=5.7B, training_protocol=1K only2022.10 | 83.3 | — | |
| SiGLIP-LEncoder=ViTL-16, Evaluation Protocol=Linear probing2026.02 | 83.1 | — | |
| ImageNet-21kModel Architecture=ViT-B, Resolution=384^2, Pre-training Type=SL2023.03 | 83 | — | |
| ConvNeXt-Teval size=224x224, params=29M, FLOPs=4.5B, training_protocol=22K+1K2022.10 | 82.9 | — | |
| DearKDTeacher=regnety-160, #params=22M, Training epochs=10002024.03 | 82.8 | — | |
| ExFractalDB-21kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 82.7 | — | |
| VisualAtom-21kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 82.7 | — | |
| RegNetY-160Teacher=none, #params=84M, Training epochs=3002024.03 | 82.6 | — | |
| DeiT-STeacher=regnety-160, #params=22M, Training epochs=10002024.03 | 82.6 | — | |
| RCDB-21kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 82.4 | — | |
| RCDB-1kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 82.3 | — | |
| VisualAtom-1kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 82.3 | — | |
| VD-STeacher=regnety-160, #params=22M, Training epochs=3002024.03 | 82.3 | — | |
| ResNeXt-101Pretraining=IG-940M2021.08 | 82.2 | — | |
| ConvNeXt-Teval size=224x224, params=29M, FLOPs=4.5B, training_protocol=1K only2022.10 | 82.1 | — | |
| SRDTeacher=regnety-160, #params=22M, Training epochs=3002024.03 | 82.1 | — | |
| CivT-STeacher=regnety-4gf + rednet-50, #params=22M, Training epochs=3002024.03 | 82 | — | |
| ImageNet-21kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=SL2023.03 | 81.8 | — | |
| NAT-miniResolution=224 x 2242025.11 | 81.8 | — | |
| PVT-Largeeval size=224x224, params=61.4M, FLOPs=9.8B, training_protocol=1K only2022.10 | 81.7 | — | |
| CoAtNet-0eval size=224x224, params=25M, FLOPs=4.2B, training_protocol=1K only2022.10 | 81.6 | — | |
| Swin-TResolution=256 x 2562025.11 | 81.6 | — | |
| HNT-miniResolution=224 x 2242025.11 | 81.6 | — | |
| DearKDTeacher=regnety-160, #params=22M, Training epochs=3002024.03 | 81.5 | — | |
| HWT-TResolution=256 x 2562025.11 | 81.5 | — | |
| MaskedKDTeacher=deit3-b, #params=22M, Training epochs=3002024.03 | 81.4 | — | |
| ViT-B/32Pretraining=ANN-1.3B2021.08 | 81.4 | — | |
| Swin-Teval size=224x224, params=28M, FLOPs=4.5B, training_protocol=1K only2022.10 | 81.3 | — | |
| DeiT-STeacher=regnety-160, #params=22M, Training epochs=3002024.03 | 81.2 | — | |
| Swin-TResolution=224 x 2242025.11 | 81.2 | — | |
| HWT-TResolution=224 x 2242025.11 | 81 | — | |
| USKDTeacher=regnety-160, #params=22M, Training epochs=3002024.03 | 80.8 | — | |
| ViT-B/32Pretraining=JFT-300M2021.08 | 80.7 | — | |
| ResNet-101Pretraining=JFT-300M2021.08 | 80.6 | — | |
| ExFractalDB-1kModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=FDSL2023.03 | 80.4 | — | |
| ScratchModel Architecture=ViT-B, Resolution=224^2, Pre-training Type=None2023.03 | 79.8 | — | |
| DeiT-STeacher=none, #params=22M, Training epochs=3002024.03 | 79.8 | — | |
| LR-LoRABackbone=CLIP ViT-B/32, Rank (r)=16, Adapter Placement=attention and MLP projections, Number of Seeds=32026.06 | 79.6 | — | |
| RandLoRABackbone=CLIP ViT-B/32, Rank (r)=16, Adapter Placement=attention and MLP projections, Number of Seeds=32026.06 | 78.9 | — |