Image-to-Text Retrieval on COCO
85.4R@1BLIP2
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| BLIP2FLOPs=717.5, Throughput=10.82026.01 | 85.4 | 97 | — | — | — | — | — | — | — | |
| VisionTrimFLOPs=265.2, Throughput=27.5, Delta FLOPs=63.0%, Delta Throughput=154.6%2026.01 | 85.1 | 97 | — | — | — | — | — | — | — | |
| TurboFLOPs=396.5, Throughput=18.6, Delta FLOPs=44.9%, Delta Throughput=72.2%2026.01 | 84.2 | 96.2 | — | — | — | — | — | — | — | |
| MADTPGFLOPs=87.42024.03 | 79.1 | 94.2 | 97.2 | — | — | — | — | — | — | |
| UPopGFLOPs=88.32024.03 | 77.4 | 93.4 | 97 | — | — | — | — | — | — | |
| AAPEEvaluation Protocol=Train or Finetune, Note=Learned on COCO2024.10 | 76.7 | 94.5 | 97.4 | — | — | — | — | — | — | |
| ObjEmbedParameters=4B2026.02 | 75.7 | — | — | — | — | — | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 75.2 | — | — | — | — | — | — | — | — | |
| FG-CLIP2Backbone=ViT-So/162026.02 | 74.6 | — | — | — | — | — | — | — | — | |
| OscarEvaluation Protocol=Train or Finetune2024.10 | 73.5 | 92.2 | 96 | — | — | — | — | — | — | |
| ELIPGFLOPs=93.42024.03 | 72 | 91.9 | 95.9 | — | — | — | — | — | — | |
| SigLIP 2Setting=Zero-shot2026.02 | 71.7 | — | — | — | — | — | — | — | — | |
| ToMeGFLOPs=69.82024.03 | 71.5 | 91.6 | 95.9 | — | — | — | — | — | — | |
| SigLIP2ViT=L/16, Data=10B2026.01 | 71.5 | — | — | — | — | — | — | — | — | |
| UME-R1Parameters=2B2026.02 | 71.4 | — | — | — | — | — | — | — | — | |
| SigLIP2Backbone=ViT-So/162026.02 | 71 | — | — | — | — | — | — | — | — | |
| EVA-CLIP-8BSetting=Zero-shot2026.02 | 70.3 | — | — | — | — | — | — | — | — | |
| SigLIPSetting=Zero-shot2026.02 | 70.2 | — | — | — | — | — | — | — | — | |
| Qwen3-VL-EmbeddingParameters=2B2026.02 | 69.6 | — | — | — | — | — | — | — | — | |
| SigLIPViT=L/16, Data=10B2026.01 | 69.6 | — | — | — | — | — | — | — | — | |
| VersaViTVision backbone state=Unfrozen, Projection layer fine-tuning=true, Training data alignment=30M image-text pairs2026.02 | 69.5 | — | — | — | — | — | — | — | — | |
| SigLIP2ViT=B/16, Data=10B2026.01 | 68.9 | — | — | — | — | — | — | — | — | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Image Encoder=ViT-B/162023.11 | 68.8 | — | — | — | — | — | — | — | — | |
| MobileCLIP-B (LT)Training Dataset=DataCompDR-1B, Image Encoder=ViT-B/162023.11 | 68.7 | — | — | — | — | — | — | — | — | |
| LlipEvaluation Protocol=Zero-shot2024.10 | 68.1 | 87.6 | 92.5 | — | — | — | — | — | — | |
| GMEParameters=7B2026.02 | 67.8 | — | — | — | — | — | — | — | — | |
| GMEParameters=2B2026.02 | 67.3 | — | — | — | — | — | — | — | — | |
| VeCLIP-B/16Training Dataset=WIT-200M, Image Encoder=ViT-B/162023.11 | 67.2 | — | — | — | — | — | — | — | — | |
| EViTGFLOPs=48.02024.03 | 66.8 | 88.9 | 93.9 | — | — | — | — | — | — | |
| MetaCLIP2Backbone=ViT-H/142026.02 | 66.8 | — | — | — | — | — | — | — | — | |
| Ensemble TeacherTraining Dataset=DataComp-1B [18], OpenAI-400M [47], Image Encoder=ViT-L/142023.11 | 66.5 | — | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-L/142026.02 | 66 | — | — | — | — | — | — | — | — | |
| SigLIP-B/16Training Dataset=Webli-1B, Image Encoder=ViT-B/162023.11 | 65.7 | — | — | — | — | — | — | — | — | |
| SigLIPEvaluation Protocol=Zero-shot2024.10 | 65.4 | 85.1 | 91.1 | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-L/142026.02 | 65.1 | — | — | — | — | — | — | — | — | |
| SigLIPViT=B/16, Data=10B2026.01 | 64.5 | — | — | — | — | — | — | — | — | |
| LongD-CLIPBackbone=ViT-L/142026.02 | 64.4 | — | — | — | — | — | — | — | — | |
| EVA-CLIPBackbone=ViT-L/142026.02 | 64.2 | — | — | — | — | — | — | — | — | |
| DINOv3Setting=Zero-shot2026.02 | 63.7 | — | — | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=02023.06 | 63.7 | — | — | — | — | — | — | — | — | |
| MobileCLIP-S2Training Dataset=DataCompDR-1B, Image Encoder=MCi22023.11 | 63.4 | — | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/142026.02 | 63.4 | — | — | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DCI2025.12 | 62.86 | 83.44 | — | — | — | — | — | — | — | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DOCCI2025.12 | 62.82 | 84.04 | — | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-L/142026.02 | 62.8 | — | — | — | — | — | — | — | — | |
| VLM2Vec-V2Parameters=2B2026.02 | 62.6 | — | — | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=12B2023.06 | 62.6 | — | — | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=12B, Zero-shot=true, Frozen transfer=true2023.06 | 62.6 | — | — | — | — | — | — | — | — | |
| TULIPBackbone=ViT-L/142026.02 | 62.6 | — | — | — | — | — | — | — | — | |
| Unicoder-VLEvaluation Protocol=Train or Finetune2024.10 | 62.3 | 87.1 | 92.8 | — | — | — | — | — | — | |
| Long-CLIP + GMAILZero-shot=true, Pre-trained=true2026.02 | 62.3 | 84.1 | 91.2 | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=12B2023.06 | 62.3 | — | — | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=12B, Zero-shot=true, Frozen transfer=true2023.06 | 62.3 | — | — | — | — | — | — | — | — | |
| MobileCLIP-S1Training Dataset=DataCompDR-1B, Image Encoder=MCi12023.11 | 62.2 | — | — | — | — | — | — | — | — | |
| SmartCLIPBackbone=ViT-B/162026.02 | 61.9 | — | — | — | — | — | — | — | — | |
| DeBias-CLIPBackbone=ViT-B/162026.02 | 61.3 | — | — | — | — | — | — | — | — | |
| GOALBackbone=ViT-L/14, Fine-tuning dataset=DCI2025.12 | 61.12 | 83.3 | — | — | — | — | — | — | — | |
| MulCLIPBackbone=ViT-L/14, Fine-tuning dataset=DOCCI2025.12 | 60.76 | 83 | — | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=3B2023.06 | 60.7 | — | — | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=3B, Zero-shot=true, Frozen transfer=true2023.06 | 60.7 | — | — | — | — | — | — | — | — | |
| VersaViTVision backbone state=Frozen, Projection layer fine-tuning=true, Training data alignment=30M image-text pairs2026.02 | 60.5 | — | — | — | — | — | — | — | — | |
| DFN-B/16Training Dataset=DFN-2B [16], Image Encoder=ViT-B/162023.11 | 60.4 | — | — | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=3B2023.06 | 60.3 | — | — | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=3B, Zero-shot=true, Frozen transfer=true2023.06 | 60.3 | — | — | — | — | — | — | — | — | |
| LAION-B/16Training Dataset=LAION-2B [52], Image Encoder=ViT-B/162023.11 | 59.4 | — | — | — | — | — | — | — | — | |
| DataComp-B/16Training Dataset=DataComp-1B [18], Image Encoder=ViT-B/162023.11 | 59.4 | — | — | — | — | — | — | — | — | |
| LongD-CLIPBackbone=ViT-B/162026.02 | 59.4 | — | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Fine-tuning dataset=DOCCI2025.12 | 59.14 | 82 | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-L/14, Fine-tuning dataset=DCI2025.12 | 58.8 | 81.94 | — | — | — | — | — | — | — | |
| MobileCLIP-S0Training Dataset=DataCompDR-1B, Image Encoder=MCi02023.11 | 58.7 | — | — | — | — | — | — | — | — | |
| OpenAI-B/16Training Dataset=WIT-400M [47], Image Encoder=ViT-B/162023.11 | 58.7 | — | — | — | — | — | — | — | — | |
| EVA02-B/16Training Dataset=Merged-2B [55], Image Encoder=ViT-B/162023.11 | 58.7 | — | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-B/162026.02 | 58.7 | — | — | — | — | — | — | — | — | |
| CLIPEvaluation Protocol=Zero-shot2024.10 | 58.4 | 81.5 | 88.1 | — | — | — | — | — | — | |
| CLIP* (16k)LiT pairs=02023.06 | 58.2 | — | — | — | — | — | — | — | — | |
| MTVViT=L/16, Data=100M2026.01 | 58.1 | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-L/142026.02 | 58 | — | — | — | — | — | — | — | — | |
| DataComp-B/32-256Training Dataset=DataComp-1B [18], Image Encoder=ViT-B/32-2562023.11 | 57.9 | — | — | — | — | — | — | — | — | |
| CLIP* L/14LiT pairs=900M2023.06 | 57.7 | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Fine-tuning dataset=None2025.12 | 57.68 | 80.2 | — | — | — | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/162026.02 | 57.6 | — | — | — | — | — | — | — | — | |
| Long-CLIPZero-shot=true, Pre-trained=true2026.02 | 57.2 | 80.8 | 87.8 | — | — | — | — | — | — | |
| MTVViT=B/16, Data=100M2026.01 | 57.1 | — | — | — | — | — | — | — | — | |
| CLIP* (16k)LiT pairs=12B2023.06 | 57 | — | — | — | — | — | — | — | — | |
| CLIP*LiT pairs=12B, Zero-shot=true, Frozen transfer=true2023.06 | 57 | — | — | — | — | — | — | — | — | |
| TinyCLIP-63M/32Training Dataset=LAION-400M [51], YFCC-15M [57], Image Encoder=ViT-63M/322023.11 | 56.9 | — | — | — | — | — | — | — | — | |
| GOALBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 56.84 | 80.2 | — | — | — | — | — | — | — | |
| CLIP + GMAILZero-shot=true, Pre-trained=true2026.02 | 56.8 | 80.1 | 87.2 | — | — | — | — | — | — | |
| TULIPBackbone=ViT-B/162026.02 | 56.8 | — | — | — | — | — | — | — | — | |
| CLIP* (8k)LiT pairs=02023.06 | 56.7 | — | — | — | — | — | — | — | — | |
| FineLIPBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 56.68 | 80.14 | — | — | — | — | — | — | — | |
| CapPa L/14LiT pairs=900M2023.06 | 56.6 | — | — | — | — | — | — | — | — | |
| CLIP L/14LiT tuning=false2023.06 | 56.6 | — | — | — | — | — | — | — | — | |
| CLIP L/14LiT pairs=3B, Zero-shot=true, Frozen transfer=true2023.06 | 56.6 | — | — | — | — | — | — | — | — | |
| CLIP-LSetting=Zero-shot2026.02 | 56.3 | — | — | — | — | — | — | — | — | |
| CLIPViT=L/14, Data=400M2026.01 | 56.3 | — | — | — | — | — | — | — | — | |
| LAION-B/32Training Dataset=LAION-2B [52], Image Encoder=ViT-B/322023.11 | 56.2 | — | — | — | — | — | — | — | — | |
| CLIP* (8k)LiT pairs=12B2023.06 | 56.1 | — | — | — | — | — | — | — | — | |
| CLIPBackbone=ViT-L/142026.02 | 56.1 | — | — | — | — | — | — | — | — | |
| GOALBackbone=ViT-B/16, Fine-tuning dataset=DCI2025.12 | 55.82 | 79.1 | — | — | — | — | — | — | — |