Image Classification on VTAB 19 tasks (test)
77.63AccuracyVision Transformer (ViT-H/14)
Evaluation Results
| Method | Links | |
|---|---|---|
| Vision Transformer (ViT-H/14)Pre-training Dataset=JFT-300M, Architecture=ViT-H/142020.10 | 77.63 | |
| BiT-LArchitecture=ResNet152x42020.10 | 76.29 | |
| Vision Transformer (ViT-L/16)Pre-training Dataset=JFT-300M, Architecture=ViT-L/162020.10 | 76.28 | |
| Vision Transformer (ViT-L/16)Pre-training Dataset=ImageNet-21k, Architecture=ViT-L/162020.10 | 72.72 |