Image Classification on ObjectNet (test)
52R@1RobustViT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RobustViTBackbone=AR-L, Annotated segmentation=false2022.06 | 52 | 73.5 | — | |
| RobustViTBackbone=AR-L, Annotated segmentation=true2022.06 | 51.6 | 73.2 | — | |
| ALIGN (Baseline)Evaluation Protocol=zero-shot2022.05 | 51.6 | — | — | |
| ViT-B/16Pretraining=ANN-1.3B2021.08 | 50.7 | — | — | |
| ALIGN-MRLRep. Size=768, Evaluation Protocol=zero-shot2022.05 | 49.26 | — | — | |
| ALIGN-MRLRep. Size=384, Evaluation Protocol=zero-shot2022.05 | 49.1 | — | — | |
| ResNet-101Pretraining=JFT-300M2021.08 | 49.1 | — | — | |
| ViT-B/32Pretraining=ANN-1.3B2021.08 | 48.4 | — | — | |
| ALIGN-MRLRep. Size=192, Evaluation Protocol=zero-shot2022.05 | 48.24 | — | — | |
| RobustViTBackbone=AR-B, Annotated segmentation=true2022.06 | 47.1 | 70 | — | |
| RobustViTBackbone=AR-B, Annotated segmentation=false2022.06 | 46.5 | 69.1 | — | |
| OriginalBackbone=AR-L, Annotated segmentation=false2022.06 | 46.5 | 68.3 | — | |
| ALIGN-MRLRep. Size=96, Evaluation Protocol=zero-shot2022.05 | 45.2 | — | — | |
| Right for the Right Reason (RRR)Backbone=AR-B, Annotated segmentation=true2022.06 | 43.7 | 65.9 | — | |
| RobustViTBackbone=ViT-L, Annotated segmentation=false2022.06 | 43.2 | 65.8 | — | |
| ALIGN-MRLRep. Size=48, Evaluation Protocol=zero-shot2022.05 | 42.76 | — | — | |
| GradMaskBackbone=AR-B, Annotated segmentation=true2022.06 | 42.7 | 64.8 | — | |
| RobustViTBackbone=ViT-L, Annotated segmentation=true2022.06 | 42.5 | 65.4 | — | |
| ResNet-50Pretraining=JFT-300M2021.08 | 42.5 | — | — | |
| RobustViTBackbone=ViT-B, Annotated segmentation=true2022.06 | 42.2 | 65.1 | — | |
| OriginalBackbone=AR-B, Annotated segmentation=false2022.06 | 41.4 | 63.7 | — | |
| RobustViTBackbone=ViT-B, Annotated segmentation=false2022.06 | 40.8 | 64 | — | |
| RobustViTBackbone=AR-S, Annotated segmentation=false2022.06 | 39.3 | 61.7 | — | |
| RobustViTBackbone=AR-S, Annotated segmentation=true2022.06 | 38.7 | 61.1 | — | |
| Right for the Right Reason (RRR)Backbone=ViT-B, Annotated segmentation=true2022.06 | 38.1 | 60 | — | |
| GradMaskBackbone=AR-S, Annotated segmentation=true2022.06 | 37.6 | 60.2 | — | |
| OriginalBackbone=ViT-L, Annotated segmentation=false2022.06 | 37.4 | 59.5 | — | |
| GradMaskBackbone=ViT-B, Annotated segmentation=true2022.06 | 36.7 | 58.2 | — | |
| RobustViTBackbone=DeiT-B, Annotated segmentation=false2022.06 | 36.3 | 56.6 | — | |
| RobustViTBackbone=DeiT-B, Annotated segmentation=true2022.06 | 35.9 | 56.2 | — | |
| ALIGN-MRLRep. Size=24, Evaluation Protocol=zero-shot2022.05 | 35.89 | — | — | |
| OriginalBackbone=ViT-B, Annotated segmentation=false2022.06 | 35.1 | 56.4 | — | |
| Right for the Right Reason (RRR)Backbone=AR-S, Annotated segmentation=true2022.06 | 35.1 | 56.7 | — | |
| OriginalBackbone=AR-S, Annotated segmentation=false2022.06 | 34.3 | 55.8 | — | |
| Right for the Right Reason (RRR)Backbone=DeiT-B, Annotated segmentation=true2022.06 | 33.6 | 53.3 | — | |
| GradMaskBackbone=DeiT-B, Annotated segmentation=true2022.06 | 33.5 | 53.1 | — | |
| RobustViTBackbone=DeiT-S, Annotated segmentation=true2022.06 | 31.6 | 53 | — | |
| RobustViTBackbone=DeiT-S, Annotated segmentation=false2022.06 | 31.6 | 52.9 | — | |
| OriginalBackbone=DeiT-B, Annotated segmentation=false2022.06 | 31.4 | 48.5 | — | |
| Right for the Right Reason (RRR)Backbone=DeiT-S, Annotated segmentation=true2022.06 | 29.3 | 49.9 | — | |
| OriginalBackbone=DeiT-S, Annotated segmentation=false2022.06 | 28.3 | 47.3 | — | |
| GradMaskBackbone=DeiT-S, Annotated segmentation=true2022.06 | 28.2 | 48.6 | — | |
| ALIGN-MRLRep. Size=12, Evaluation Protocol=zero-shot2022.05 | 25.52 | — | — | |
| ABEBackbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 30.15 | |
| NC@5 (Neural Coherence)Backbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 36.51 | |
| NCEBackbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 16.9 | |
| PaLI-15BModel Size=15B, Zero-shot=true2022.09 | — | 55.29 | — | |
| PaLI-17BModel Size=17B, Zero-shot=true2022.09 | — | 58.35 | — | |
| PaLI-3BModel Size=3B, Zero-shot=true2022.09 | — | 53.71 | — | |
| PARCBackbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 2.17 | |
| ResNet-18Backbone=ResNet-18, RPG=false, DoF=11M, Evaluation Protocol=Zero-shot OOD2021.07 | — | — | 13.4 | |
| ResNet-34Backbone=ResNet-34, RPG=false, DoF=21M, Evaluation Protocol=Zero-shot OOD2021.07 | — | — | 16 | |
| ResNet-34-RPGBackbone=ResNet-34, RPG=true, DoF=11M, Evaluation Protocol=Zero-shot OOD2021.07 | — | — | 16.5 | |
| Source-ValBackbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 36.55 | |
| Target-ValBackbone=ConvNeXt-Large, Pre-training=ImageNet, Scenario=Scenario B2025.12 | — | — | 30.44 |