Image-to-Text Retrieval on Urban1k
95.2R@1DeBias-CLIP
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DeBias-CLIPBackbone=ViT-L/14, Venue=-2026.02 | 95.2 | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 94.5 | — | — | — | — | |
| SmartCLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 93.3 | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/16, Venue=-2026.02 | 93.1 | — | — | — | — | |
| LongD-CLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 91.9 | — | — | — | — | |
| FineLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 91.2 | — | — | — | — | |
| TULIPBackbone=ViT-L/14, Venue=ICLR252026.02 | 90.1 | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 90 | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-L/14, Zero-shot setting=true2025.03 | 89.8 | 97.8 | 99.6 | 100 | — | |
| GOALBackbone=ViT-L/14, Training Data=DCI2025.12 | 89.8 | 97.8 | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DCI2025.12 | 89.7 | 97.9 | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 88.3 | 97.3 | — | — | — | |
| TULIPBackbone=ViT-B/16, Venue=ICLR252026.02 | 88.1 | — | — | — | — | |
| LongD-CLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 87.2 | — | — | — | — | |
| Fix-CLIPBackbone=ViT-L/14, Venue=ICCV252026.02 | 86.8 | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-L/14, Zero-shot setting=true2025.03 | 86.3 | 96.5 | 99.4 | 100 | — | |
| GOALBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 86.3 | 96.5 | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DCI2025.12 | 85.2 | 97 | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 84 | 96.1 | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-B/16, Zero-shot setting=true2025.03 | 82.9 | 96.8 | 99.4 | 99.7 | — | |
| GOALBackbone=ViT-B/16, Training Data=DCI2025.12 | 82.9 | 96.8 | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Zero-shot setting=true2025.03 | 82.6 | 96.7 | 99.6 | 100 | — | |
| Long-CLIPBackbone=ViT-L/14, Venue=ECCV242026.02 | 82.5 | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-B/16, Zero-shot setting=true2025.03 | 81.9 | 95.8 | 99.4 | 99.7 | — | |
| GOALBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 81.9 | 95.8 | — | — | — | |
| Fix-CLIPBackbone=ViT-B/16, Venue=ICCV252026.02 | 80.9 | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DCI2025.12 | 79.5 | 94.8 | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Zero-shot setting=true2025.03 | 79.2 | 94.8 | 99.1 | 99.7 | — | |
| Long-CLIPBackbone=ViT-B/16, Venue=ECCV242026.02 | 78.9 | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 78.7 | 94.2 | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DCI2025.12 | 78.6 | 94.9 | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 77.4 | 93.9 | — | — | — | |
| CLIPBackbone=ViT-B/16, Zero-shot setting=true2025.03 | 68.9 | 88.8 | 97.9 | 99.5 | — | |
| CLIPBackbone=ViT-L/14, Venue=ICML212026.02 | 68.5 | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Zero-shot setting=true2025.03 | 68.2 | 88.4 | 97 | 98.7 | — | |
| CLIPBackbone=ViT-B/16, Venue=ICML212026.02 | 67.5 | — | — | — | — | |
| CE-CLIPModel=CE-CLIP2025.09 | — | — | — | — | 53.5 | |
| CLIPModel=CLIP2025.09 | — | — | — | — | 59.9 | |
| DACLLMModel=DACLLM2025.09 | — | — | — | — | 11.4 | |
| DCIP1Model=DCIP12025.09 | — | — | — | — | 29.7 | |
| DreamLIPModel=DreamLIP2025.09 | — | — | — | — | 79.8 | |
| LongCLIPModel=LongCLIP2025.09 | — | — | — | — | 77.9 | |
| LSSModel=LSS2025.09 | — | — | — | — | 75.4 | |
| NegCLIPModel=NegCLIP2025.09 | — | — | — | — | 64.6 | |
| SigLIPModel=SigLIP2025.09 | — | — | — | — | 62.9 |