Image-to-Text Retrieval on DOCCI
91.3R@1Gemini Embedding 2
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Gemini Embedding 2Modality=V/A/I/T2026.05 | 91.3 | — | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-L/14, Venue=-2026.02 | 85.2 | — | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 84.8 | 97.88 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 83.7 | — | — | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-L/14, Zero-shot=false2025.03 | 82.57 | 97.37 | 99.82 | 99.98 | — | — | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 82.57 | 97.37 | — | — | — | — | — | — | |
| HiMo-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 82.35 | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 82.2 | — | — | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 82.12 | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 81.6 | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 81.6 | — | — | — | — | — | — | — | |
| StructXLIPfinetuning_mode=Full-parameter2026.02 | 81.59 | 96.94 | — | — | 98.78 | — | — | — | |
| CAFTTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 80.6 | — | — | — | — | — | — | — | |
| CAFT++Training Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 80.4 | — | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 80.26 | 96.88 | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 80 | — | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/16, Venue=-2026.02 | 79.7 | — | — | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-B/16, Zero-shot=false2025.03 | 79.43 | 96.14 | 99.61 | 99.9 | — | — | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 79.43 | 96.14 | — | — | — | — | — | — | |
| GOALfinetuning_mode=Full-parameter2026.02 | 79.43 | 96.14 | — | — | 97.25 | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-L/14, Zero-shot=true2025.03 | 79.16 | 95.96 | 99.61 | 99.9 | — | — | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DCI2025.12 | 79.16 | 95.96 | — | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 78.41 | — | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DCI2025.12 | 78.35 | 95.31 | — | — | — | — | — | — | |
| MobileCLIPv2Seen Data=12B2026.05 | 78 | 94.9 | 98.98 | 99.61 | — | — | — | — | |
| TULIPBackbone=ViT-L/14, Venue=ICLR252026.02 | 77.9 | — | — | — | — | — | — | — | |
| TULIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 77.9 | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 77.4 | — | — | — | — | — | — | — | |
| Voyage-3.5-multimodalModality=V/I/T2026.05 | 77.4 | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 77.4 | — | — | — | — | — | — | — | |
| HiMo-CLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 77.37 | — | — | — | — | — | — | — | |
| FineLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 77.16 | — | — | — | — | — | — | — | |
| FineLIPTraining Data Scale=400M to 1M, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 77.1 | — | — | — | — | — | — | — | |
| Amazon Nova MMEModality=V/A/I/T2026.05 | 76.5 | — | — | — | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 75.44 | 94.6 | — | — | — | — | — | — | |
| SmartCLIPfinetuning_mode=Full-parameter2026.02 | 74.91 | 94.04 | — | — | 97.29 | — | — | — | |
| FAST-GOALSeen Data=400M+100k2026.05 | 74.67 | 94.71 | 99.24 | 99.75 | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-B/16, Zero-shot=true2025.03 | 72.18 | 92.88 | 98.88 | 99.55 | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DCI2025.12 | 71.75 | 92.96 | — | — | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DCI2025.12 | 71.54 | 92.56 | — | — | — | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 71.5 | 93.24 | — | — | — | — | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DCI2025.12 | 71.18 | 92.88 | — | — | — | — | — | — | |
| FLAIRTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 70.3 | — | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Zero-shot=true2025.03 | 66.82 | 91.9 | 99.04 | 99.82 | — | — | — | — | |
| Long-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 66.78 | — | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Venue=ECCV242026.02 | 66.5 | — | — | — | — | — | — | — | |
| FineLIPfinetuning_mode=Full-parameter2026.02 | 66.39 | 89.12 | — | — | 94.47 | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DCI2025.12 | 66.32 | 90.72 | — | — | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Venue=ICML212026.02 | 65.8 | — | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Zero-shot=true2025.03 | 63.29 | 88.8 | 98.39 | 99.45 | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Venue=ECCV242026.02 | 63.1 | — | — | — | — | — | — | — | |
| Long-CLIP†Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 63.1 | — | — | — | — | — | — | — | |
| Long-CLIPfinetuning_mode=Full-parameter2026.02 | 63.08 | 87.45 | — | — | 93.14 | — | — | — | |
| CLIPBackbone=ViT-B/16, Venue=ICML212026.02 | 60.6 | — | — | — | — | — | — | — | |
| TinyCLIPSeen Data=400M2026.05 | 58.88 | 83.63 | 95.35 | 97.82 | — | — | — | — | |
| SigLIPv2Seen Data=10B2026.05 | 48.39 | 74.41 | 90.49 | 94.82 | — | — | — | — | |
| CLIP ViT-L/14 + TEVITraining Data=CC12M2026.06 | 26.06 | 51.5 | — | — | 62.2 | — | — | — | |
| SigLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 24.52 | 48.6 | — | — | 59.58 | — | — | — | |
| CLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 24.2 | 48.68 | — | — | 60.06 | — | — | — | |
| CLIP ViT-L/14Training Data=CC12M2026.06 | 23.6 | 46.68 | — | — | 57.06 | — | — | — | |
| AlignCLIP ViT-B/16 + TEVITraining Data=CC12M2026.06 | 23.18 | 47.7 | — | — | 58.9 | — | — | — | |
| SharedCLIP + TEVITraining Data=CC12M2026.06 | 22.54 | 45.54 | — | — | 57.1 | — | — | — | |
| SigLIP ViT-B/16Training Data=CC12M2026.06 | 20.68 | 41.84 | — | — | 53.7 | — | — | — | |
| CLIP ViT-B/16Training Data=CC12M2026.06 | 20.38 | 42.36 | — | — | 53.52 | — | — | — | |
| AlignCLIP ViT-B/16Training Data=CC12M2026.06 | 20.32 | 41.88 | — | — | 53.38 | — | — | — | |
| SharedCLIPTraining Data=CC12M2026.06 | 19.02 | 41.06 | — | — | 52.68 | — | — | — | |
| CE-CLIPModel=CE-CLIP2025.09 | — | — | — | — | — | — | 43.1 | — | |
| CLIMP (VMamba)Vision Tower=VMamba, Text Tower=Mamba-22026.01 | — | 62.6 | — | — | — | — | — | — | |
| CLIMP (VMamba)Vision Tower=VMamba, Text Tower=Mamba-12026.01 | — | 67.1 | — | — | — | — | — | — | |
| CLIPArchitecture=L/142026.04 | — | — | — | — | — | 44.4 | — | — | |
| CLIPModel=CLIP2025.09 | — | — | — | — | — | — | 50.3 | — | |
| DACLLMModel=DACLLM2025.09 | — | — | — | — | — | — | 36.6 | — | |
| DCIP1Model=DCIP12025.09 | — | — | — | — | — | — | 42.9 | — | |
| DreamLIPModel=DreamLIP2025.09 | — | — | — | — | — | — | 69.9 | — | |
| DreamLIP2025.09 | — | — | — | — | — | — | — | 69.7 | |
| FlexViTVision Tower=FlexViT, Text Tower=LLaMA2026.01 | — | 42.8 | — | — | — | — | — | — | |
| LongCLIPModel=LongCLIP2025.09 | — | — | — | — | — | — | 61.4 | — | |
| LSSModel=LSS2025.09 | — | — | — | — | — | — | 64.5 | — | |
| LSSBackbone=ViT-B/162025.09 | — | — | — | — | — | — | — | 67.8 | |
| NaFlexVision Tower=NaFlex, Text Tower=LLaMA2026.01 | — | 55.3 | — | — | — | — | — | — | |
| NegCLIPModel=NegCLIP2025.09 | — | — | — | — | — | — | 53.9 | — | |
| RoPE-ViTVision Tower=RoPE-ViT, Text Tower=LLaMA2026.01 | — | 39.5 | — | — | — | — | — | — | |
| SigLIPModel=SigLIP2025.09 | — | — | — | — | — | — | 70.3 | — | |
| SigLIP2025.09 | — | — | — | — | — | — | — | 70.6 | |
| TIPSArchitecture=g/142026.04 | — | — | — | — | — | 57.2 | — | — | |
| TIPSv2Architecture=g/142026.04 | — | — | — | — | — | 68.9 | — | — |