Context-to-Image (T-I) Retrieval on set (test)
77.09R@1CP-CLIP
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CP-CLIPBackbone=ViT-B/16, Model Variant=(D)2026.06 | 77.09 | 94.69 | 97.87 | 99.21 | 99.74 | 84.79 | |
| CP-CLIPBackbone=ViT-L/16, Model Variant=(D)2026.06 | 73.83 | 92.93 | 96.44 | 98.49 | 99.61 | 82.15 | |
| CP-CLIPBackbone=ViT-B/16, Model Variant=(fp)2026.06 | 72.97 | 93.96 | 97.47 | 99.1 | 99.86 | 82.13 | |
| CLIPBackbone=ViT-B/162026.06 | 66.8 | 90.8 | 95.4 | 97.89 | 99.38 | 77.19 | |
| SigLIPBackbone=ViT-B/162026.06 | 43.85 | 67.38 | 77.44 | 85.75 | 93.19 | 54.57 | |
| SigLIPBackbone=ViT-B/16, Model Variant=(D)2026.06 | 25.93 | 52.21 | 61.37 | 71.45 | 85.38 | 38.42 |