Text-to-Image Retrieval on DCI
79.7R@1Qwen3-VL-Embedding
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 79.7 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DCI2025.12 | 78.83 | 91.39 | — | — | — | — | |
| ObjEmbedParameters=4B2026.02 | 76.9 | — | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 76.89 | 91.05 | 96.55 | 97.75 | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DCI2025.12 | 76.89 | 91.05 | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 76.19 | — | — | — | — | — | |
| StructXLIPfinetuning_mode=Full-parameter2026.02 | 75.9 | 90 | — | — | 95.15 | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DCI2025.12 | 75.13 | 89.44 | — | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 74.6 | — | — | — | — | — | |
| HiMo-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 74.54 | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-L/14, Venue=-2026.02 | 73.5 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 72.93 | 88 | — | — | — | — | |
| GOAL DCI fine-tuningBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 72.64 | 89.89 | 95.95 | 97.25 | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DCI2025.12 | 72.64 | 89.89 | — | — | — | — | |
| GOALfinetuning_mode=Full-parameter2026.02 | 72.64 | 89.89 | — | — | 93.7 | — | |
| CAFT++Training Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 72.4 | — | — | — | — | — | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 72.1 | — | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 72.1 | — | — | — | — | — | |
| HyFL-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 71.79 | — | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 71.6 | — | — | — | — | — | |
| HiMo-CLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 69.93 | — | — | — | — | — | |
| SmartCLIPfinetuning_mode=Full-parameter2026.02 | 69.88 | 86.64 | — | — | 94.05 | — | |
| SmartCLIPBackbone=ViT-L/14, Venue=CVPR252026.02 | 69.8 | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 69.8 | — | — | — | — | — | |
| CAFTTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 69.4 | — | — | — | — | — | |
| MulCLIPBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 69.08 | 85.99 | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 68.93 | 85.74 | 93.95 | 96 | — | — | |
| GOALBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 68.93 | 85.74 | — | — | — | — | |
| FineLIP*Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 68.03 | — | — | — | — | — | |
| UME-R1Parameters=2B2026.02 | 67.9 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Setting=Zero-shot2025.03 | 67.88 | 83.29 | 91.8 | 94.8 | — | — | |
| Long-CLIP†Backbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 67.83 | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/16, Venue=-2026.02 | 67.6 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-L/14, Venue=ICCV252026.02 | 66.7 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-L-14, Evaluation Protocol=Zero-shot2026.07 | 66.7 | — | — | — | — | — | |
| FLAIRTraining Data Scale=30M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 66.2 | — | — | — | — | — | |
| FLAIRData=DreamLIP 30M, Backbone=ViT-B/162025.12 | 66.2 | — | — | — | — | — | |
| TULIPBackbone=ViT-L/14, Venue=ICLR252026.02 | 66.2 | — | — | — | — | — | |
| FineLIPfinetuning_mode=Full-parameter2026.02 | 66.13 | 85.34 | — | — | 89.79 | — | |
| FG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 66.1 | — | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DCI2025.12 | 66.03 | 84.49 | — | — | — | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 65.3 | — | — | — | — | — | |
| β-CLIP (BCE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Objective=BCE2025.12 | 65.1 | — | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 64.9 | — | — | — | — | — | |
| GMEParameters=7B2026.02 | 64.6 | — | — | — | — | — | |
| Smart-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 64.5 | — | — | — | — | — | |
| GOAL DOCCI fine-tuningBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 64.13 | 82.69 | 92.95 | 95.4 | — | — | |
| GOALBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 64.13 | 82.69 | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/16, Venue=CVPR252026.02 | 64 | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 64 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Venue=ECCV242026.02 | 63.9 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-B/16, Venue=ICCV252026.02 | 63 | — | — | — | — | — | |
| Fix-CLIPBackbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 63 | — | — | — | — | — | |
| FineLipBackbone=ViT-L/14, Training Data=DOCCI2025.12 | 62.88 | 81.69 | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Setting=Zero-shot2025.03 | 61.33 | 80.79 | 91.65 | 94.35 | — | — | |
| Long-CLIP†Backbone=ViT-B-16, Evaluation Protocol=Zero-shot2026.07 | 61.28 | — | — | — | — | — | |
| LoTLIPTraining Data Scale=100M, Training Strategy=Trained on Long-Captions from Scratch, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 61 | — | — | — | — | — | |
| LoTLIPData=Mixed-100M, Backbone=ViT-B/162025.12 | 61 | — | — | — | — | — | |
| FG-CLIPTraining Data Scale=400M to 1.6B, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 60.6 | — | — | — | — | — | |
| FG-CLIP (w/ hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg. + 10M hard negatives, Backbone=ViT-B/162025.12 | 60.6 | — | — | — | — | — | |
| FG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 60.6 | — | — | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DCI2025.12 | 60.38 | 80.39 | — | — | — | — | |
| β-CLIP (CE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Objective=CE2025.12 | 59.9 | — | — | — | — | — | |
| Long-CLIPfinetuning_mode=Full-parameter2026.02 | 59.23 | 80.89 | — | — | 87.04 | — | |
| GMEParameters=2B2026.02 | 58.8 | — | — | — | — | — | |
| FineLipBackbone=ViT-B/16, Training Data=DOCCI2025.12 | 58.58 | 78.64 | — | — | — | — | |
| ALIGNTraining Data Scale=700M, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 57.4 | — | — | — | — | — | |
| Long-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 57.4 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 57.3 | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Venue=ECCV242026.02 | 57.1 | — | — | — | — | — | |
| FAST-GOALBackbone=ViT-B/16, Zero-shot=true2026.05 | 56.62 | 75.26 | 87.75 | 91.08 | — | — | |
| FAST-GOALSeen Data=400M+100k2026.05 | 56.62 | 75.26 | 87.75 | 91.08 | — | — | |
| SigLIPTraining Data Scale=10B, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 56.2 | — | — | — | — | — | |
| SigLIPData=WebLI-1B, Backbone=ViT-B/162025.12 | 56.2 | — | — | — | — | — | |
| OpenCLIPTraining Data Scale=2B, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 55.4 | — | — | — | — | — | |
| MobileCLIPv2Seen Data=12B2026.05 | 53.04 | 72.2 | 84.81 | 89.09 | — | — | |
| Long-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 52.5 | — | — | — | — | — | |
| TULIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 50.6 | — | — | — | — | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 50.2 | — | — | — | — | — | |
| Meta CLIP 2Backbone=ViT-H/14, Evaluation Protocol=Zero-shot2025.10 | 50.2 | — | — | — | — | — | |
| SigLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 49.3 | — | — | — | — | — | |
| GOALBackbone=ViT-B/16, Zero-shot=true2026.05 | 49.13 | 70.17 | 84.53 | 88.69 | — | — | |
| Long-CLIPBackbone=ViT-B/16, Zero-shot=true2026.05 | 48.41 | 68.71 | 82.49 | 87.16 | — | — | |
| EVA-CLIPBackbone=ViT-L/142026.02 | 47.8 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 47.8 | — | — | — | — | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 47.1 | — | — | — | — | — | |
| SigLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 47.1 | — | — | — | — | — | |
| FineCLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 46.2 | — | — | — | — | — | |
| VLM2VecParameters=2B2026.02 | 44.2 | — | — | — | — | — | |
| Long-CLIPTraining Data Scale=400M to 1M, Training Strategy=Finetuned on Long-Captions, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 44.1 | — | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Venue=ICML212026.02 | 43.8 | — | — | — | — | — | |
| CLIPData=WIT-400M, Backbone=ViT-B/162025.12 | 43 | — | — | — | — | — | |
| CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 43 | — | — | — | — | — | |
| CLIPBackbone=ViT-B/16, Venue=ICML212026.02 | 42.9 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-B/16, Zero-shot=true2026.05 | 41.25 | 61.19 | 77.62 | 83.03 | — | — | |
| EVA-CLIPData=Merged-2B, Backbone=ViT-B/162025.12 | 41.2 | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 41.2 | — | — | — | — | — | |
| LiTTraining Data Scale=100M, Training Strategy=Trained on Short-Captions Only, Vision Encoder=ViT-B/16, Zero-shot=true2026.02 | 40.9 | — | — | — | — | — | |
| FineCLIPBackbone=ViT-B/16, Zero-shot=true2026.05 | 37.7 | 58.3 | 75.82 | 81.6 | — | — | |
| CLIPBackbone=ViT-L/142026.02 | 36.4 | — | — | — | — | — |