Image-to-Text Retrieval on DCI
77.9R@1Qwen3-VL-Embedding
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 77.9 | — | — | — | — | — | |
| ObjEmbedParameters=4B2026.02 | 77.2 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DCI2025.12 | 76.83 | 92.09 | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 76.59 | 91.2 | 96.55 | 98.25 | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DCI2025.12 | 76.59 | 91.2 | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 74.74 | — | — | — | — | — | |
| HiMo-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 74.59 | — | — | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 74.5 | — | — | — | — | — | |
| StructXLIPfinetuning_mode=Full-parameter2026.02 | 74.39 | 89.9 | — | — | 94.3 | — | |
| GOAL DCI fine-tuningBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 72.84 | 90.5 | 96.6 | 97.9 | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DCI2025.12 | 72.84 | 90.5 | — | — | — | — | |
| GOALfinetuning_mode=Full-parameter2026.02 | 72.84 | 90.5 | — | — | 93.2 | — | |
| DeBias-CLIPBackbone=ViT-L/14, Venue=-2026.02 | 72.8 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 72.03 | 86.64 | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DCI2025.12 | 72 | 89.24 | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 71.54 | — | — | — | — | — | |
| HiMo-CLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 71.09 | — | — | — | — | — | |
| SmartCLIPfinetuning_mode=Full-parameter2026.02 | 70.94 | 87.04 | — | — | 92.77 | — | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 70.6 | — | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 70.6 | — | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 70 | — | — | — | — | — | |
| CAFT++Training Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 69.7 | — | — | — | — | — | |
| CAFTTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 69.4 | — | — | — | — | — | |
| FineLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 69.38 | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/16, Venue=-2026.02 | 68.5 | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 68.43 | 85.99 | 93.9 | 96.25 | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 68.43 | 85.99 | — | — | — | — | |
| SmartCLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 68.2 | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 68.2 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 67.13 | 84.24 | — | — | — | — | |
| FG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 66.7 | — | — | — | — | — | |
| TULIPBackbone=ViT-L/14, Venue=ICLR252026.02 | 66 | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 65.88 | 83.44 | 92.95 | 95.65 | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 65.88 | 83.44 | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DCI2025.12 | 65.58 | 85.19 | — | — | — | — | |
| Smart-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 65.3 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-L/14, Venue=ICCV252026.02 | 65.1 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 65.1 | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 64.9 | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 64.9 | — | — | — | — | — | |
| FineLIPfinetuning_mode=Full-parameter2026.02 | 64.58 | 84.59 | — | — | 89.54 | — | |
| FG-CLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 64.5 | — | — | — | — | — | |
| Long-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 64.13 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 64.08 | 84.84 | 93.35 | 95.75 | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 63.68 | 83.44 | — | — | — | — | |
| β-CLIP (BCE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Objective=BCE2025.12 | 63.6 | — | — | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DCI2025.12 | 63.58 | 82.94 | — | — | — | — | |
| LoTLIPData=100M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 62.1 | — | — | — | — | — | |
| LoTLIPTraining Data Scale=100M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 62.1 | — | — | — | — | — | |
| LoTLIPData=Mixed-100M, Backbone=ViT-B/162025.12 | 62.1 | — | — | — | — | — | |
| FG-CLIPTraining Data Scale=400M to 1.6B, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 61.8 | — | — | — | — | — | |
| FG-CLIP (w/ hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg. + 10M hard negatives, Backbone=ViT-B/162025.12 | 61.8 | — | — | — | — | — | |
| FG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 61.8 | — | — | — | — | — | |
| FLAIRData=30M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 61.3 | — | — | — | — | — | |
| FLAIRTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 61.3 | — | — | — | — | — | |
| FLAIRData=DreamLIP 30M, Backbone=ViT-B/162025.12 | 61.3 | — | — | — | — | — | |
| Long-CLIPfinetuning_mode=Full-parameter2026.02 | 60.13 | 81.44 | — | — | 87.54 | — | |
| Long-CLIPBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 60.03 | 81.44 | 92.8 | 95.05 | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 59.88 | 80.39 | — | — | — | — | |
| Long-CLIP†Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 59.88 | — | — | — | — | — | |
| GMEParameters=7B2026.02 | 59.8 | — | — | — | — | — | |
| UME-R1Parameters=2B2026.02 | 59.8 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-B/16, Venue=ICCV252026.02 | 59.7 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 59.7 | — | — | — | — | — | |
| β-CLIP (CE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Objective=CE2025.12 | 58.4 | — | — | — | — | — | |
| SigLIPData=10B, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 57.7 | — | — | — | — | — | |
| SigLIPTraining Data Scale=10B, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 57.7 | — | — | — | — | — | |
| SigLIPData=WebLI-1B, Backbone=ViT-B/162025.12 | 57.7 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Venue=ECCV242026.02 | 57 | — | — | — | — | — | |
| FAST-GOALSeen Data=400M+100k2026.05 | 56.74 | 75.99 | 88.71 | 92.46 | — | — | |
| ALIGNData=700M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 56.5 | — | — | — | — | — | |
| ALIGNTraining Data Scale=700M, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 56.5 | — | — | — | — | — | |
| OpenCLIPData=2B, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 56 | — | — | — | — | — | |
| OpenCLIPTraining Data Scale=2B, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 56 | — | — | — | — | — | |
| FLAIRData=12M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 55.5 | — | — | — | — | — | |
| MobileCLIPv2Seen Data=12B2026.05 | 55.06 | 73.61 | 86.16 | 90 | — | — | |
| FLAIRData=15M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 54.9 | — | — | — | — | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 53.1 | — | — | — | — | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 53 | — | — | — | — | — | |
| Meta CLIP 2Backbone=ViT-H/14, Evaluation Protocol=Zero-shot2025.10 | 53 | — | — | — | — | — | |
| GMEParameters=2B2026.02 | 52.9 | — | — | — | — | — | |
| Long-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 51.8 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 51.7 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Venue=ECCV242026.02 | 51.6 | — | — | — | — | — | |
| TULIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 50.2 | — | — | — | — | — | |
| SigLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 48 | — | — | — | — | — | |
| Long-CLIPData=400M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 47.4 | — | — | — | — | — | |
| Long-CLIPTraining Data Scale=400M to 1M, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 47.4 | — | — | — | — | — | |
| FLAIRData=3M, Zero-shot=true, Vision Encoder=ViT-B/162024.12 | 47.3 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-L/142026.02 | 47.2 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 47.2 | — | — | — | — | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 46 | — | — | — | — | — | |
| SigLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 46 | — | — | — | — | — | |
| CLIPData=WIT-400M, Backbone=ViT-B/162025.12 | 45.5 | — | — | — | — | — | |
| CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 45.5 | — | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Venue=ICML212026.02 | 44.8 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 44.2 | — | — | — | — | — | |
| CLIPBackbone=ViT-B/16, Venue=ICML212026.02 | 44.1 | — | — | — | — | — | |
| EVA-CLIPData=Merged-2B, Backbone=ViT-B/162025.12 | 41.9 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 41.9 | — | — | — | — | — |