Text-to-Image Retrieval on Urban1k (test)
92.2R@1CS-Aligner-3M
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CS-Aligner-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 92.2 | — | — | — | |
| LLM2CLIP-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | 91.1 | — | — | — | |
| CLIP+GOALBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 86.3 | 96.5 | 99.4 | 100 | |
| Long-CLIP2025.02 | 86.1 | — | — | — | |
| CLIP+GOALBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 81.9 | 95.8 | 99.4 | 99.7 | |
| CLIP+LongCLIPBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 70.2 | 89.8 | 97.5 | 98.7 | |
| CLIPBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 68.9 | 88.8 | 97.9 | 99.95 | |
| CLIPBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 68.2 | 88.4 | 97 | 98.8 | |
| CLIP+LongCLIPBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 63.6 | 85.9 | 96.8 | 99 | |
| CLIP2025.02 | 55.6 | — | — | — |