Image-to-Text Retrieval on MS-COCO 2017 (val)
22R@1 (I2T)SigLIP2-So/16-256
Evaluation Results
| Method | Links | |
|---|---|---|
| SigLIP2-So/16-256Pre-trained Backbone=SigLIP2-So/16, Resolution=2562025.03 | 22 | |
| DualTokenPre-trained Backbone=SigLIP2-So/16-2562025.03 | 21.9 | |
| SigLIP-So/14-384Pre-trained Backbone=SigLIP-So/14, Resolution=3842025.03 | 21.6 | |
| DualTokenPre-trained Backbone=SigLIP-So/14-3842025.03 | 21.6 | |
| CLIP-L/14-336Pre-trained Backbone=CLIP-L/14, Resolution=3362025.03 | 21.5 | |
| SigLIP-L/16-256Pre-trained Backbone=SigLIP-L/16, Resolution=2562025.03 | 21.4 | |
| DualTokenPre-trained Backbone=SigLIP-L/16-2562025.03 | 21.4 | |
| ViTamin-L/16-256Pre-trained Backbone=ViTamin-L/16, Resolution=2562025.03 | 21.2 | |
| QLIPResolution=392px2025.03 | 21 | |
| QLIPResolution=256px2025.03 | 18.4 | |
| VILA-UPre-trained Backbone=SigLIP-L/16-2562025.03 | 11.2 |