Zero-shot Image-Text Retrieval on DOCCI
66.2AccuracyCLIPS (ViT-L/14)
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIPS (ViT-L/14)Backbone=ViT-L/142026.03 | 66.2 | |
| SigLIP ViT-L/16-res256Backbone=ViT-L/16, Input Resolution=256x2562026.03 | 62.5 | |
| SigLIP2-ViT-B/16Backbone=ViT-B/162026.03 | 62.2 | |
| C^2LIPBackbone=ViT-B/162026.03 | 60 | |
| CLIP-A (ViT-L/14)Backbone=ViT-L/142026.03 | 59.4 | |
| BLIP-BBackbone=ViT-B2026.03 | 51.6 | |
| FLAVABackbone=ViT-B2026.03 | 48.3 |