Deep Metric Learning on InShop
96.5Recall@1VPTSP (CLIP vision)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VPTSP (CLIP vision)Architecture=Vit-L/14, Pre-training Set=Laion2b2024.02 | 96.5 | — | — | |
| Hyp-ViTBackbone=ViT-S16, Feature Dimension=384, Batch Size=882/9002024.02 | 92.5 | 98.3 | 98.8 | |
| VPTSP-GBackbone=ViT-B16, Feature Dimension=512, Batch Size=64/322024.02 | 92.5 | 98.2 | 98.9 | |
| VPTSP-GBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 91.2 | 97.6 | 98.4 | |
| VPTSP-MBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 90.8 | 97.7 | 98.6 | |
| VPTSP (MAE)Architecture=Vit-B/16, Pre-training Set=ImageNet 1K2024.02 | 90.3 | — | — | |
| VPTSP (DINO)Architecture=Vit-S/16, Pre-training Set=ImageNet 1K2024.02 | 90.1 | — | — | |
| VPTSP (DeiT)Architecture=Vit-S/16, Pre-training Set=ImageNet 1K2024.02 | 88.7 | — | — | |
| VPT-BaseBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 88.4 | 97.5 | 98.4 |