Image Classification on Composite ImageNet Distribution Shifts (test)
85.02Average AccuracyGreedy soup
Evaluation Results
| Method | Links | |
|---|---|---|
| Greedy soupBackbone=ViT-G/14, Pre-training Dataset=JFT-3B2022.03 | 85.02 | |
| Best model in hyperparam searchBackbone=ViT-G/14, Pre-training Dataset=JFT-3B2022.03 | 84.68 | |
| ViT-G (reevaluated)Backbone=ViT-G/14, Pre-training Dataset=JFT-3B2022.03 | 82.06 | |
| CLAPBackbone=ViT-B/162023.12 | 60.04 | |
| Zero-ShotBackbone=ViT-B/162023.12 | 57.17 | |
| TaskRes(e)Backbone=ViT-B/162023.12 | 55.35 | |
| ZS-LPBackbone=ViT-B/162023.12 | 53.65 | |
| CLIP-AdapterBackbone=ViT-B/162023.12 | 50.72 | |
| CLAPBackbone=ResNet-502023.12 | 42.91 | |
| TIP-AdapterBackbone=ViT-B/162023.12 | 41.55 | |
| TIP-Adapter(f)Backbone=ResNet-502023.12 | 41.36 | |
| TaskRes(e)Backbone=ResNet-502023.12 | 41.28 | |
| TIP-AdapterBackbone=ResNet-502023.12 | 40.69 | |
| Zero-ShotBackbone=ResNet-502023.12 | 40.61 | |
| Rand. Init LPBackbone=ViT-B/162023.12 | 40.41 | |
| ZS-LPBackbone=ResNet-502023.12 | 36.58 | |
| TIP-Adapter(f)Backbone=ViT-B/162023.12 | 35.58 | |
| CLIP-AdapterBackbone=ResNet-502023.12 | 31.21 | |
| Rand. Init LPBackbone=ResNet-502023.12 | 24.61 |