Text-to-Image Retrieval on DOCCI
93.4Recall@1Gemini Embedding 2
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Gemini Embedding 2Modality=V/A/I/T2026.05 | 93.4 | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 86.73 | 98.1 | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-L/14, Venue=-2026.02 | 85.6 | — | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 85.39 | — | — | — | — | — | — | |
| HiMo-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 84.59 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 84.4 | — | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-L/14, Zero-shot=false2025.03 | 84.37 | 97.55 | 99.76 | 99.98 | — | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 84.37 | 99.55 | — | — | — | — | — | |
| Amazon Nova MMEModality=V/A/I/T2026.05 | 84 | — | — | — | — | — | — | |
| Voyage-3.5-multimodalModality=V/I/T2026.05 | 83.8 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 83.1 | — | — | — | — | — | — | |
| StructXLIPfinetuning_mode=Full-parameter2026.02 | 83.04 | 97.06 | — | — | 98.96 | — | — | |
| SmartCLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 82.5 | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 82.5 | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 82.2 | 97.12 | — | — | — | — | — | |
| CAFT++Training Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 82 | — | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 81.12 | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DCI2025.12 | 81.04 | 96.33 | — | — | — | — | — | |
| CAFTTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 80.4 | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/16, Venue=-2026.02 | 80 | — | — | — | — | — | — | |
| MobileCLIPv2Seen Data=12B2026.05 | 79.65 | 95.29 | 99.1 | 99.59 | — | — | — | |
| FineLIPTraining Data Scale=400M to 1M, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 79.5 | — | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-B/16, Zero-shot=false2025.03 | 79.47 | 96.65 | 99.69 | 99.92 | — | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 79.47 | 96.65 | — | — | — | — | — | |
| GOALfinetuning_mode=Full-parameter2026.02 | 79.47 | 96.65 | — | — | 98.69 | — | — | |
| HiMo-CLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 79.35 | — | — | — | — | — | — | |
| FineLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 79.14 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-L/14, Venue=ICLR252026.02 | 79.1 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 79.1 | — | — | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-L/14, Zero-shot=true2025.03 | 79.04 | 95.78 | 99.55 | 99.84 | — | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DCI2025.12 | 79.04 | 95.78 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Zero-shot=true2025.03 | 78.84 | 95.25 | 99.19 | 99.59 | — | — | — | |
| Long-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 78.61 | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Venue=ECCV242026.02 | 78.6 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 78.1 | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 78 | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 78 | — | — | — | — | — | — | |
| SmartCLIPfinetuning_mode=Full-parameter2026.02 | 74.92 | 94.08 | — | — | 97.31 | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 74.7 | 94.24 | — | — | — | — | — | |
| FAST-GOALSeen Data=400M+100k2026.05 | 74.27 | 93.76 | 99.27 | 99.71 | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DCI2025.12 | 73.78 | 93.86 | — | — | — | — | — | |
| FLAIRTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 72.6 | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Zero-shot=true2025.03 | 71.63 | 92.16 | 98.9 | 99.73 | — | — | — | |
| Long-CLIP†Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 71.49 | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Venue=ECCV242026.02 | 71.4 | — | — | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-B/16, Zero-shot=true2025.03 | 71.22 | 92.39 | 98.9 | 99.61 | — | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DCI2025.12 | 71.22 | 92.39 | — | — | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 70.94 | 92.98 | — | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DCI2025.12 | 68.84 | 90.92 | — | — | — | — | — | |
| FineLIPfinetuning_mode=Full-parameter2026.02 | 67.8 | 90.22 | — | — | 94.84 | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DCI2025.12 | 65.5 | 89.3 | — | — | — | — | — | |
| Long-CLIPfinetuning_mode=Full-parameter2026.02 | 64.49 | 87.67 | — | — | 93.43 | — | — | |
| CLIPBackbone=ViT-L/14, Venue=ICML212026.02 | 63 | — | — | — | — | — | — | |
| TinyCLIPSeen Data=400M2026.05 | 59.1 | 83.9 | 95.43 | 97.94 | — | — | — | |
| CLIPBackbone=ViT-B/16, Venue=ICML212026.02 | 57.1 | — | — | — | — | — | — | |
| SigLIPv2Seen Data=10B2026.05 | 49.24 | 75.73 | 90.76 | 94.71 | — | — | — | |
| CLIP ViT-L/14 + TEVITraining Data=CC12M2026.06 | 9.26 | 21.51 | — | — | 27.99 | — | — | |
| CLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 8.55 | 19.98 | — | — | 26.8 | — | — | |
| SigLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 8.47 | 20.02 | — | — | 26.47 | — | — | |
| AlignCLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 8.32 | 19.76 | — | — | 26.34 | — | — | |
| CLIP ViT-L/14Training Data=CC12M2026.06 | 8.21 | 18.7 | — | — | 24.91 | — | — | |
| SharedCLIP + TEVITraining Data=CC12M2026.06 | 7.95 | 18.62 | — | — | 25.31 | — | — | |
| SigLIP ViT-B/16Training Data=CC12M2026.06 | 7.41 | 17.17 | — | — | 22.77 | — | — | |
| AlignCLIP ViT-B/16Training Data=CC12M2026.06 | 7.39 | 17.43 | — | — | 23.69 | — | — | |
| CLIP ViT-B/16Training Data=CC12M2026.06 | 7.16 | 16.96 | — | — | 22.86 | — | — | |
| SharedCLIPTraining Data=CC12M2026.06 | 7.16 | 17.52 | — | — | 23.88 | — | — | |
| CE-CLIPModel=CE-CLIP2025.09 | — | — | — | — | — | — | 55.4 | |
| CLIMP (VMamba)Vision Tower=VMamba, Text Tower=Mamba-22026.01 | — | 51.7 | — | — | — | — | — | |
| CLIMP (VMamba)Vision Tower=VMamba, Text Tower=Mamba-12026.01 | — | 50.4 | — | — | — | — | — | |
| CLIPArchitecture=L/142026.04 | — | — | — | — | — | 40.4 | — | |
| CLIPModel=CLIP2025.09 | — | — | — | — | — | — | 52.4 | |
| DACLLMModel=DACLLM2025.09 | — | — | — | — | — | — | 39.7 | |
| DCIP1Model=DCIP12025.09 | — | — | — | — | — | — | 46.3 | |
| DreamLIPModel=DreamLIP2025.09 | — | — | — | — | — | — | 69.5 | |
| FlexViTVision Tower=FlexViT, Text Tower=LLaMA2026.01 | — | 36.3 | — | — | — | — | — | |
| LongCLIPModel=LongCLIP2025.09 | — | — | — | — | — | — | 69.3 | |
| LSSModel=LSS2025.09 | — | — | — | — | — | — | 63 | |
| NaFlexVision Tower=NaFlex, Text Tower=LLaMA2026.01 | — | 53.4 | — | — | — | — | — | |
| NegCLIPModel=NegCLIP2025.09 | — | — | — | — | — | — | 62.2 | |
| RoPE-ViTVision Tower=RoPE-ViT, Text Tower=LLaMA2026.01 | — | 27.9 | — | — | — | — | — | |
| SigLIPModel=SigLIP2025.09 | — | — | — | — | — | — | 70.8 | |
| TIPSArchitecture=g/142026.04 | — | — | — | — | — | 58.8 | — | |
| TIPSv2Architecture=g/142026.04 | — | — | — | — | — | 72.8 | — |