Text-to-Image Retrieval on MS-COCO 2017 (val)
21.7R@1 (T2I)SigLIP-So/14-384
Evaluation Results
| Method | Links | |
|---|---|---|
| SigLIP-So/14-384Pre-trained Backbone=SigLIP-So/14, Resolution=3842025.03 | 21.7 | |
| SigLIP2-So/16-256Pre-trained Backbone=SigLIP2-So/16, Resolution=2562025.03 | 21.5 | |
| DualTokenPre-trained Backbone=SigLIP-So/14-3842025.03 | 21.5 | |
| CLIP-L/14-336Pre-trained Backbone=CLIP-L/14, Resolution=3362025.03 | 21.2 | |
| DualTokenPre-trained Backbone=SigLIP2-So/16-2562025.03 | 21.1 | |
| SigLIP-L/16-256Pre-trained Backbone=SigLIP-L/16, Resolution=2562025.03 | 21 | |
| DualTokenPre-trained Backbone=SigLIP-L/16-2562025.03 | 20.8 | |
| ViTamin-L/16-256Pre-trained Backbone=ViTamin-L/16, Resolution=2562025.03 | 20.6 | |
| QLIPResolution=392px2025.03 | 20.4 | |
| QLIPResolution=256px2025.03 | 16.8 | |
| VILA-UPre-trained Backbone=SigLIP-L/16-2562025.03 | 10 |