Image-to-Text Retrieval on Urban1k (test)
83R@1CLIP+GOAL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CLIP+GOALBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 83 | 95.4 | 99.7 | 99.9 | — | |
| ReasonSigLIP (Stage 2)Model Scale=ViT So400m (428M), Resolution=384/14, Training Data Scale=+16M, Base Model=SigLIP2026.06 | 78.6 | 92.3 | — | — | — | |
| ReasonSigLIP (Stage 1)Model Scale=ViT So400m (428M), Resolution=384/14, Training Data Scale=+42M, Base Model=SigLIP2026.06 | 77.5 | 93.1 | — | — | — | |
| SigLIPModel Scale=ViT So400m (428M), Resolution=384/14, Training Data Scale=10.0B2026.06 | 74.5 | 91.9 | — | — | — | |
| CLIP+GOALBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 73.2 | 92.7 | 98.3 | 99.4 | — | |
| CLIP+LongCLIPBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 61.3 | 83.9 | 96.8 | 98.8 | — | |
| CLIP+LongCLIPBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 60.6 | 83 | 96 | 98.6 | — | |
| CLIPBackbone=ViT-L/14, Fine-tuned on=DOCCI2025.03 | 53.9 | 78.4 | 92.2 | 95.8 | — | |
| CLIPBackbone=ViT-B/16, Fine-tuned on=DOCCI2025.03 | 53.3 | 76.7 | 91.5 | 95.4 | — | |
| CLIP2025.02 | — | — | — | — | 68.3 | |
| CS-Aligner-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | — | — | — | — | 87.6 | |
| LLM2CLIP-3MBackbone=CLIP ViT-L/14, Text Encoder=Llama 3 (8B), Training Data=CC3M2025.02 | — | — | — | — | 87.1 | |
| Long-CLIP2025.02 | — | — | — | — | 82.5 |