Image Classification on ImageNet 1k (val) (Top-1 Accuracy)
94.8Top-1 AccDRiFt_Temps
Evaluation Results
| Method | Links | |
|---|---|---|
| DRiFt_TempsEnsembling strategy=DRiFt, Calibrator=Temperature Scaling, Backbone=ResNet-502021.11 | 94.8 | |
| PoE_TempsEnsembling strategy=Product of Experts, Calibrator=Temperature Scaling, Backbone=ResNet-502021.11 | 94.7 | |
| PoEEnsembling strategy=Product of Experts, Calibrator=None, Backbone=ResNet-502021.11 | 94.6 | |
| PoE_DirichletEnsembling strategy=Product of Experts, Calibrator=Dirichlet, Backbone=ResNet-502021.11 | 94.6 | |
| DRiFtEnsembling strategy=DRiFt, Calibrator=None, Backbone=ResNet-502021.11 | 94.6 | |
| DRiFt_DirichletEnsembling strategy=DRiFt, Calibrator=Dirichlet, Backbone=ResNet-502021.11 | 94.5 | |
| InvREnsembling strategy=Inverse-Risk, Calibrator=None, Backbone=ResNet-502021.11 | 94.5 | |
| InvR_DirichletEnsembling strategy=Inverse-Risk, Calibrator=Dirichlet, Backbone=ResNet-502021.11 | 94.4 | |
| InvR_TempsEnsembling strategy=Inverse-Risk, Calibrator=Temperature Scaling, Backbone=ResNet-502021.11 | 94.3 | |
| LMin_DirichletEnsembling strategy=Learned-Mixin, Calibrator=Dirichlet, Backbone=ResNet-502021.11 | 91.2 | |
| LMin_TempsEnsembling strategy=Learned-Mixin, Calibrator=Temperature Scaling, Backbone=ResNet-502021.11 | 91.1 | |
| Greedy ensembleBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=greedy ensemble2022.03 | 91.02 | |
| CoCaBackbone=CoCa, Evaluation Protocol=fine-tuned2022.03 | 91 | |
| Greedy soupBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=greedy soup2022.03 | 90.98 | |
| ViT-G/14 greedy soupBackbone=ViT/G-14, Model Selection Strategy=greedy soup2022.03 | 90.94 | |
| LMinEnsembling strategy=Learned-Mixin, Calibrator=None, Backbone=ResNet-502021.11 | 90.9 | |
| CoAtNet-7Backbone=CoAtNet-72022.03 | 90.88 | |
| Best model on each test set (oracle)Backbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=oracle (best on test set)2022.03 | 90.87 | |
| Best model on held out val setBackbone=BASIC-L, Evaluation Protocol=fine-tuned, Model Selection Strategy=best on val set2022.03 | 90.83 | |
| ViT G/14Pre-training=JFT 3B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 90.5 | |
| ViT/G-14Backbone=ViT/G-142022.03 | 90.45 | |
| V-MoE-15B, Every-2Evaluation Protocol=Fine-tuning2021.06 | 90.35 | |
| MPLEvaluation Protocol=Fine-tuning2021.06 | 90.2 | |
| NFNet-F4+Evaluation Protocol=Fine-tuning2021.06 | 89.2 | |
| ViT H/14Pre-training=JFT 300M, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.6 | |
| ViT H/14Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.6 | |
| ViT L/16Pre-training=JFT 3B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.5 | |
| EfficientNet L2Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.4 | |
| V-MoE-H/14, Every-2Evaluation Protocol=Fine-tuning2021.06 | 88.36 | |
| V-MoE-H/14, Last-5Evaluation Protocol=Fine-tuning2021.06 | 88.23 | |
| RegNetY 128GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.2 | |
| ViT L/16Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 88.1 | |
| ViT-H/14Evaluation Protocol=Fine-tuning2021.06 | 88.08 | |
| ViT L/16Pre-training=JFT 300M, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 87.8 | |
| V-MoE-L/16, Every-2Evaluation Protocol=Fine-tuning2021.06 | 87.41 | |
| VOLO-D5↑512Architecture=VOLO, Params=296M, FLOPs=412B, Train size=224, Test size=5122021.06 | 87.1 | |
| VOLO-D5↑448Architecture=VOLO, Params=296M, FLOPs=304B, Train size=224, Test size=4482021.06 | 87 | |
| EfficientNet B7Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 86.9 | |
| VOLO-D4↑448Architecture=VOLO, Params=193M, FLOPs=197B, Train size=224, Test size=4482021.06 | 86.8 | |
| RegNetY 32GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 86.8 | |
| NFNet# Params (M)=438, Input Size=576, Conv=true2021.04 | 86.5 | |
| NFNet-F6 [2]+SAMArchitecture=CNN, Params=438M, FLOPs=377B, Train size=448, Test size=5762021.06 | 86.5 | |
| CaiT-M48↑448 [52]Architecture=Transformer, Params=356M, FLOPs=330B, Train size=224, Test size=4482021.06 | 86.5 | |
| EfficientNet B6Pre-training=JFT 300M+, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 86.4 | |
| VOLO-D3↑448Architecture=VOLO, Params=86M, FLOPs=67.9B, Train size=224, Test size=4482021.06 | 86.3 | |
| CaiT-M36↑448 [52]Architecture=Transformer, Params=271M, FLOPs=248B, Train size=224, Test size=4482021.06 | 86.3 | |
| CoCaBackbone=CoCa, Evaluation Protocol=zero-shot2022.03 | 86.3 | |
| VOLO-D5Architecture=VOLO, Params=296M, FLOPs=69.0B, Train size=224, Test size=2242021.06 | 86.1 | |
| VOLO-D2↑384Architecture=VOLO, Params=59M, FLOPs=46.1B, Train size=224, Test size=3842021.06 | 86 | |
| NFNet-F5 [2]Architecture=CNN, Params=377M, FLOPs=290B, Train size=416, Test size=5442021.06 | 86 | |
| XCiT-L24/8Y↑#params=189M, FLOPs=417.8B, Resolution=3842021.06 | 86 | |
| RegNetY 16GFPre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 86 | |
| Refined-ViT-L↑448Params=81M, FLOPS=98.0B, Train size=224, Test size=4482021.06 | 85.9 | |
| Refined-ViT-L↑448 [79]Architecture=Transformer, Params=81M, FLOPs=98.0B, Train size=224, Test size=4482021.06 | 85.9 | |
| NFNet-F4 [2]Architecture=CNN, Params=316M, FLOPs=215B, Train size=384, Test size=5122021.06 | 85.9 | |
| EffNet-B8# Params (M)=87, Input Size=672, Conv=true2021.04 | 85.8 | |
| XCiT-M24/8Y↑#params=84M, FLOPs=187.9B, Resolution=3842021.06 | 85.8 | |
| CaiT-M24Y↑#params=186M, FLOPs=116.1B, Resolution=3842021.06 | 85.8 | |
| XCiT-L24/16Y↑#params=189M, FLOPs=106.0B, Resolution=3842021.06 | 85.8 | |
| EffNetV2-L# Params (M)=121, Input Size=384, Conv=true2021.04 | 85.7 | |
| Fix-EfficientNet-B8Params=87M, FLOPS=89.5B, Train size=672, Test size=8002021.06 | 85.7 | |
| Refined-ViT-L↑384Params=81M, FLOPS=69.1B, Train size=224, Test size=3842021.06 | 85.7 | |
| Fix-EfficientNet-B8 [50, 53]Architecture=CNN, Params=87M, FLOPs=89.5B, Train size=672, Test size=8002021.06 | 85.7 | |
| NFNet-F3 [2]Architecture=CNN, Params=255M, FLOPs=115.0B, Train size=320, Test size=4162021.06 | 85.7 | |
| VOLO-D4Architecture=VOLO, Params=193M, FLOPs=43.8B, Train size=224, Test size=2242021.06 | 85.7 | |
| Fix-EfficientNet-B8#params=87M, FLOPs=89.5B, Resolution=8002021.06 | 85.7 | |
| NFNet-F3#params=255M, FLOPs=114.8B, Resolution=4162021.06 | 85.7 | |
| CoAtNet-2Image size=384^2, #Param.=75M, #FLOPS=49.8G2022.03 | 85.7 | |
| BASIC-LBackbone=BASIC-L, Evaluation Protocol=zero-shot2022.03 | 85.7 | |
| Refined-ViT-M↑384Params=55M, FLOPS=49.2B, Train size=224, Test size=3842021.06 | 85.6 | |
| XCiT-S24/8Y↑#params=48M, FLOPs=105.9B, Resolution=3842021.06 | 85.6 | |
| EfficientNet B8Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 85.5 | |
| CaiT-S36↑384Params=68M, FLOPS=48.0B, Train size=224, Test size=3842021.06 | 85.4 | |
| CaiT-S36 384 [52]Architecture=Transformer, Params=68M, FLOPs=48.0B, Train size=224, Test size=3842021.06 | 85.4 | |
| LV-ViT-M↑384 [32]Architecture=Transformer, Params=56M, FLOPs=42.2B, Train size=224, Test size=3842021.06 | 85.4 | |
| VOLO-D3Architecture=VOLO, Params=86M, FLOPs=20.6B, Train size=224, Test size=2242021.06 | 85.4 | |
| XCiT-M24/16Υ↑#params=84M, FLOPs=47.7B, Resolution=3842021.06 | 85.4 | |
| LV-ViT-L# Params (M)=150, Input Size=448, Conv=true2021.04 | 85.3 | |
| CaiT-S48Y↑#params=89M, FLOPs=63.8B, Resolution=3842021.06 | 85.3 | |
| ViT B/16Pre-training=IG 3.6B, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 85.3 | |
| VOLO-D1↑384Architecture=VOLO, Params=27M, FLOPs=22.8B, Train size=224, Test size=3842021.06 | 85.2 | |
| VOLO-D2Architecture=VOLO, Params=59M, FLOPs=14.1B, Train size=224, Test size=2242021.06 | 85.2 | |
| DeiT-BY↑#params=87M, FLOPs=55.5B, Resolution=3842021.06 | 85.2 | |
| EfficientNet B7Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 85.2 | |
| ViT L/16Pre-training=IN-21k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 85.2 | |
| CaiT-M36Params=271M, FLOPS=53.7B, Train size=224, Test size=2242021.06 | 85.1 | |
| NFNet-F2 [2]Architecture=CNN, Params=194M, FLOPs=62.6B, Train size=256, Test size=3522021.06 | 85.1 | |
| XCiT-S12/8Y↑#params=26M, FLOPs=55.6B, Resolution=3842021.06 | 85.1 | |
| CaiT-S24Y↑#params=47M, FLOPs=32.2B, Resolution=3842021.06 | 85.1 | |
| XCiT-S24/16Υ↑#params=48M, FLOPs=26.9B, Resolution=3842021.06 | 85.1 | |
| NFNet-F2#params=194M, FLOPs=62.6B, Resolution=3522021.06 | 85.1 | |
| EfficientNetV2-MImage size=128^2 - 380^2, #Param.=55M, #FLOPS=24G, Throughput (image/s)=280.72022.03 | 85.1 | |
| CoAtNet-1Image size=384^2, #Param.=42M, #FLOPS=27.4G2022.03 | 85.1 | |
| ViT H/14Pre-training=IN-21k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 85.1 | |
| LambdaNet-420# Params (M)=87, Input Size=320, Conv=true2021.04 | 84.9 | |
| Refined-ViT-LParams=81M, FLOPS=19.1B, Train size=224, Test size=2242021.06 | 84.9 | |
| XCiT-L24/16Υ#params=189M, FLOPs=36.1B, Resolution=2242021.06 | 84.9 | |
| EfficientNet B6Pre-training=IN-1k, Fine-tuning protocol=Finetuned on ImageNet-1k2022.01 | 84.8 | |
| SWIN-Base + DiversePatch# Params (M)=86, Input Size=384, Conv=false, Training Protocol=finetune (30 epochs)2021.04 | 84.7 | |
| NFNet-F1Params=133M, FLOPS=35.5B, Train size=224, Test size=3202021.06 | 84.7 |