Deep Metric Learning on SOP (R@1, R@10, R@100)
90.1Recall@1VPTSP (CLIP vision)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VPTSP (CLIP vision)Architecture=Vit-L/14, Pre-training Set=Laion2b2024.02 | 90.1 | — | — | |
| RS@KBackbone=ViT-B16, Feature Dimension=512, Batch Size=>2002024.02 | 88 | 96.1 | 98.6 | |
| VPTSP-GBackbone=ViT-B16, Feature Dimension=512, Batch Size=64/322024.02 | 86.8 | 95 | 98 | |
| Hyp-ViTBackbone=ViT-S16, Feature Dimension=384, Batch Size=882/9002024.02 | 85.9 | 94.9 | 98.1 | |
| VPTSP-GBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 84.4 | 93.6 | 97.3 | |
| VPTSP-MBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 82.8 | 93.1 | 97.3 | |
| VPTSP (DINO)Architecture=Vit-S/16, Pre-training Set=ImageNet 1K2024.02 | 82.6 | — | — | |
| VPT-BaseBackbone=ViT-S16, Feature Dimension=384, Batch Size=64/322024.02 | 82.1 | 92.5 | 97.1 | |
| VPTSP (DeiT)Architecture=Vit-S/16, Pre-training Set=ImageNet 1K2024.02 | 81.2 | — | — | |
| VPTSP (MAE)Architecture=Vit-B/16, Pre-training Set=ImageNet 1K2024.02 | 77.3 | — | — |