Image Classification on ImageNet (val) (Top-1 Accuracy)
89.6Top-1 AccuracyBEIT-3
Evaluation Results
| Method | Links | |
|---|---|---|
| BEIT-3publicly accessible resources only=true2022.08 | 89.6 | |
| FD-CLIPpublicly accessible resources only=true2022.08 | 89 | |
| ResNet-RS-152Resolution=224, Training Protocol=Semi-supervised, V100 latency (s)=1.48, TPUv3 latency (ms)=3202021.03 | 86.2 | |
| EfficientNet-B5Training Protocol=Semi-supervised (Noisy Student), V100 latency (s)=8.16, TPUv3 latency (ms)=15102021.03 | 86.1 | |
| BASICZero-shot=true2021.11 | 85.7 | |
| EfficientNet-B7Resolution=600, Params (M)=66, FLOPs (B)=74, TPU-v3 Latency (s)=6.0, TPU-v3 Memory (GB)=28.3, V100 Latency (s)=29.92021.03 | 84.7 | |
| ResNet-RS-420Resolution=320, Params (M)=192, FLOPs (B)=128, TPU-v3 Latency (s)=2.1, TPU-v3 Memory (GB)=15.5, V100 Latency (s)=10.22021.03 | 84.4 | |
| ResNet-RS-350Resolution=256, Params (M)=164, FLOPs (B)=69, TPU-v3 Latency (s)=1.1, TPU-v3 Memory (GB)=7.3, V100 Latency (s)=4.72021.03 | 84 | |
| EfficientNet-B6Resolution=528, Params (M)=43, FLOPs (B)=38, TPU-v3 Latency (s)=3.0, TPU-v3 Memory (GB)=16.6, V100 Latency (s)=15.72021.03 | 84 | |
| ViT-B/162023.03 | 81.2 | |
| ViT-L/162023.03 | 80.4 | |
| Diffusion ClassifierResolution=512x5122023.03 | 79.1 | |
| ReLabelBackbone=ResNet-502026.03 | 78.9 | |
| BaselineArchitecture=InceptionV3, W-bit=32, A-bit=32, Size (MB)=90.922020.01 | 78.88 | |
| ZEROQArchitecture=InceptionV3, No Data=true, No Fine-tuning=true, W-bit=8, A-bit=8, Size (MB)=22.472020.01 | 78.81 | |
| ReLabel w/ Our MaskBackbone=ResNet-502026.03 | 78.8 | |
| ZEROQArchitecture=InceptionV3, No Data=true, No Fine-tuning=true, W-bit=MP, A-bit=6, Size (MB)=17.022020.01 | 78.76 | |
| Multi-labelBackbone=ResNet-502026.03 | 78.7 | |
| Original + Label SmoothBackbone=ResNet-502026.03 | 78.2 | |
| ViT-L/322023.03 | 77.9 | |
| LLBackbone=ResNet-502026.03 | 77.8 | |
| ResNet-1012023.03 | 77.7 | |
| Original LabelBackbone=ResNet-502026.03 | 77.6 | |
| ZEROQArchitecture=InceptionV3, No Data=true, No Fine-tuning=true, W-bit=MP, A-bit=8, Size (MB)=11.352020.01 | 77.57 | |
| Diffusion ClassifierResolution=256x2562023.03 | 77.5 | |
| SCLBackbone=ResNet-502026.03 | 76.9 | |
| ResNet-502023.03 | 76.7 | |
| LAMBoptimizer=LAMB, Batch Size=16K, Training Epochs=90, Backbone=ResNet-502019.04 | 76.66 | |
| ALIGNZero-shot=true2021.11 | 76.4 | |
| CLIPZero-shot=true2021.11 | 76.2 | |
| DRConv-MobileNetV2Setting=8 regions, MADDs=328M2020.03 | 75.7 | |
| AdCoEpochs=800, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.7 | |
| NNCLREpochs=1000, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.6 | |
| DRConv-MobileNetV1Setting=8 regions, MADDs=610M2020.03 | 75.5 | |
| OBQBackbone=ResNet50, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 75.5 | |
| UniGradEpochs=800, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.5 | |
| SCEEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.4 | |
| SwaVEpochs=800, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.3 | |
| DINOEpochs=800, Evaluation protocol=linear, Multi-crop=true2022.12 | 75.3 | |
| Momentumoptimizer=Momentum, Batch Size=16K, Training Epochs=90, Backbone=ResNet-502019.04 | 75.2 | |
| BitSplitBackbone=ResNet50, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 74.94 | |
| DK-MobileNetV2Setting=global 2x2 & local 4x4, MADDs=760M2020.03 | 74.8 | |
| DRConv-MobileNetV2*Setting=8 regions, MADDs=201M, fewer computational cost=true2020.03 | 74.7 | |
| ReSSLEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 74.7 | |
| WCLEpochs=800, Evaluation protocol=linear, Multi-crop=true2022.12 | 74.7 | |
| CondConv-MobileNetV2Setting=8 weights, MADDs=329M2020.03 | 74.6 | |
| DRConv-MobileNetV1*Setting=8 regions, MADDs=344M, fewer computational cost=true2020.03 | 74.4 | |
| RVQuantArchitecture=InceptionV3, No Data=false, No Fine-tuning=false, W-bit=8, A-bit=8, Size (MB)=22.472020.01 | 74.22 | |
| TripletEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 74.1 | |
| ResNet-342023.03 | 73.8 | |
| CondConv-MobileNetV1Setting=8 weights, MADDs=600M2020.03 | 73.7 | |
| OBQBackbone=ResNet50, Bitwidth=3bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 73.61 | |
| Adamoptimizer=Adam, Batch Size=16K, Training Epochs=90, Backbone=ResNet-50, Learning Rate Scheme=Goyal et al. (2017)2019.04 | 73.48 | |
| WCLEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 73.3 | |
| AdCoEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 73.2 | |
| DRConv-ShuffleNetV2 1xSetting=8 regions, MADDs=157M2020.03 | 73.1 | |
| AdamWoptimizer=AdamW, Batch Size=16K, Training Epochs=90, Backbone=ResNet-50, Learning Rate Scheme=Goyal et al. (2017)2019.04 | 73.07 | |
| OBQBackbone=ResNet34, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 72.85 | |
| AdaQuantBackbone=ResNet50, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 72.79 | |
| SwaVEpochs=200, Evaluation protocol=linear, Multi-crop=true2022.12 | 72.7 | |
| UniGradEpochs=100, Evaluation protocol=linear, Multi-crop=true2022.12 | 72.3 | |
| DRConv-ShuffleNetV2 1x*Setting=8 regions, MADDs=109M, fewer computational cost=true2020.03 | 72.2 | |
| Adagradoptimizer=Adagrad, Batch Size=16K, Training Epochs=90, Backbone=ResNet-50, Learning Rate Scheme=Goyal et al. (2017)2019.04 | 72.01 | |
| CondConv-ShuffleNetV2 1xSetting=8 weights, MADDs=152M2020.03 | 72 | |
| MobileNetV2Setting=baseline, MADDs=300M2020.03 | 72 | |
| MobileNetV1 (Dense baseline)Backbone=MobileNetV1, Sparsity Ratio=0%2023.10 | 71.95 | |
| BitSplitBackbone=ResNet50, Bitwidth=3bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 71.76 | |
| BitSplitBackbone=ResNet34, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 71.63 | |
| RELICv2Epochs=5000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 71.4 | |
| OCSArchitecture=InceptionV3, No Data=false, No Fine-tuning=true, W-bit=6, A-bit=6, Size (MB)=17.222020.01 | 71.3 | |
| RELICv2Epochs=3000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 71.1 | |
| OBQBackbone=ResNet34, Bitwidth=3bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 71.01 | |
| Divide and ContrastEpochs=4500, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 70.7 | |
| MobileNetV1Setting=baseline, MADDs=569M2020.03 | 70.6 | |
| RELICv2Epochs=1000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 70.3 | |
| ResNet-182023.03 | 70.3 | |
| Divide and ContrastEpochs=3000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 69.8 | |
| ShuffleNetV2 1xSetting=baseline, MADDs=147M2020.03 | 69.5 | |
| AdaQuantBackbone=ResNet34, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 69.49 | |
| BaselineW-bit=32, A-bit=32, Size (MB)=9.86, Backbone=SqueezeNext2020.01 | 69.38 | |
| OBQBackbone=ResNet18, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 69.18 | |
| ZEROQNo Data=true, No Fine-tuning=true, W-bit=8, A-bit=8, Size (MB)=2.47, Backbone=SqueezeNext2020.01 | 69.17 | |
| DISSLBackbone=ResNet-50, Training Epochs=100, Batch Size=2560, Evaluation Protocol=Linear Probing, Representation Dimensionality=81922022.09 | 68.9 | |
| ZEROQNo Data=true, No Fine-tuning=true, W-bit=MP, A-bit=6, Size (MB)=1.85, Backbone=SqueezeNext2020.01 | 68.17 | |
| Feather-GlobalBackbone=MobileNetV1, Sparsity Ratio=89%2023.10 | 68.13 | |
| Divide and ContrastEpochs=1000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 67.9 | |
| BYOLEpochs=5000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 67.9 | |
| CISSLBackbone=ResNet-50, Training Epochs=100, Batch Size=2560, Evaluation Protocol=Linear Probing, Representation Dimensionality=81922022.09 | 67.7 | |
| BYOLEpochs=3000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 67.6 | |
| BitSplitBackbone=ResNet18, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 67.58 | |
| AdamWoptimizer=AdamW, Batch Size=16K, Training Epochs=90, Backbone=ResNet-50, Learning Rate Scheme=Standard2019.04 | 67.27 | |
| OBQBackbone=ResNet18, Bitwidth=3bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 67.14 | |
| DRConv-ShuffleNetV2 0.5xSetting=8 regions, MADDs=46M2020.03 | 67.1 | |
| BYOLEpochs=1000, Pre-training dataset=JFT-300M, Evaluation protocol=linear evaluation, Backbone=ResNet-502022.01 | 67 | |
| ST-3Backbone=MobileNetV1, Sparsity Ratio=89%2023.10 | 66.67 | |
| Barlow TwinsBackbone=ResNet-50, Training Epochs=100, Batch Size=2560, Evaluation Protocol=Linear Probing, Representation Dimensionality=20482022.09 | 66.1 | |
| Adamoptimizer=Adam, Batch Size=16K, Training Epochs=90, Backbone=ResNet-50, Learning Rate Scheme=Standard2019.04 | 66.04 | |
| AdaQuantBackbone=ResNet18, Bitwidth=4bit, Quantization Scheme=Uniform symmetric per-channel weight quantization2022.08 | 65.45 | |
| ProbMaskBackbone=MobileNetV1, Sparsity Ratio=89%2023.10 | 65.19 | |
| SimCLRBackbone=ResNet-50, Training Epochs=100, Batch Size=2560, Evaluation Protocol=Linear Probing, Representation Dimensionality=20482022.09 | 65.1 |