Image-to-text retrieval on MSCOCO
81.9R@1BLIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BLIPTraining Protocol=full fine-tuning, # Tunable=223M2023.05 | 81.9 | 95.4 | 97.8 | |
| BLIP# Tunable=223M, Fine-tuning strategy=full fine-tuning2025.12 | 81.9 | 95.4 | 97.8 | |
| AuroraTraining Protocol=frozen backbone, # Tunable=0.2M, Rank (r)=1282023.05 | 80.7 | 95.3 | 97.8 | |
| Null-LoRA# Tunable=6.0M, Fine-tuning strategy=frozen backbone2025.12 | 80.7 | 94.6 | 97.2 | |
| AuroraTraining Protocol=frozen backbone, # Tunable=0.1M, Rank (r)=642023.05 | 80.2 | 95.1 | 97.7 | |
| UniAdapterTraining Protocol=frozen backbone, # Tunable=18.8M, Rank (r)=5122023.05 | 80.1 | 94.6 | 97.5 | |
| LoRATraining Protocol=frozen backbone, # Tunable=10.6M, Rank (r)=322023.05 | 80 | 94.1 | 97.2 | |
| UniAdapterTraining Protocol=frozen backbone, # Tunable=4.6M, Rank (r)=1282023.05 | 79.8 | 94.2 | 97.5 | |
| UniAdapter (r=512)# Tunable=19.5M, Fine-tuning strategy=frozen backbone, rank=5122025.12 | 79.6 | 94.5 | 97.3 | |
| Gemini Embedding 2Modality=V/A/I/T2026.05 | 78.8 | — | — | |
| Aurora (r=64)# Tunable=0.6M, Fine-tuning strategy=frozen backbone, rank=642025.12 | 78 | 93.4 | 96.7 | |
| DoRA (r=32)# Tunable=10.8M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 77.8 | 93.5 | 96.6 | |
| ALBEFTraining Protocol=full fine-tuning, # Tunable=210M2023.05 | 77.6 | 94.3 | 97.2 | |
| ALBEF# Tunable=210M, Fine-tuning strategy=full fine-tuning2025.12 | 77.6 | 94.3 | 97.2 | |
| ALIGNTraining Protocol=full fine-tuning, # Tunable=820M2023.05 | 77 | 93.5 | 96.9 | |
| ALIGN# Tunable=820M, Fine-tuning strategy=full fine-tuning2025.12 | 77 | 93.5 | 96.9 | |
| LoRA (r=32)# Tunable=10.6M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 76.7 | 91.2 | 96 | |
| PE-LEncoder=ViTL-162026.02 | 75.9 | — | — | |
| FG-CLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 75.1 | — | — | |
| CLOCBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 74.8 | — | — | |
| FG-CLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 74.6 | — | — | |
| Voyage-3.5-multimodalModality=V/I/T2026.05 | 74.5 | — | — | |
| X-Ray VisualEncoder=ViTH, Parameter Count=832M, Zero-Shot evaluation=true2026.02 | 73.83 | — | — | |
| OSCARTraining Protocol=full fine-tuning, # Tunable=330M2023.05 | 73.5 | 92.2 | 96 | |
| OSCAR# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 73.5 | 92.2 | 96 | |
| XRay ModelEncoder=ViTL-162026.02 | 73.21 | — | — | |
| X-Ray VisualEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 73.21 | — | — | |
| M2-EncoderModel scale=10B, Zero-shot evaluation=true2024.01 | 72.8 | 92.3 | 96.3 | |
| PEEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 72.75 | — | — | |
| FG-CLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 72.1 | — | — | |
| SigLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 72.1 | — | — | |
| UMG-CLIPModel scale=5B, Zero-shot evaluation=true2024.01 | 71.7 | 89.8 | 94.3 | |
| SiGLIPEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 71.4 | — | — | |
| SigLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 71.2 | — | — | |
| SigLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 71 | — | — | |
| UMG-CLIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 68.9 | 89 | 94.1 | |
| UMG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 68.9 | — | — | |
| FG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 68.9 | — | — | |
| EVAModel scale=5.0B, Zero-shot evaluation=true2024.01 | 68.8 | 87.8 | 92.8 | |
| COSAExample=415M, parameters=1.2B2023.06 | 68.5 | 88 | 93 | |
| BLIP-2Example=129M2023.06 | 68.3 | 87.7 | 92.6 | |
| Amazon Nova MMEModality=V/A/I/T2026.05 | 68.3 | — | — | |
| multimodalembedding@001Modality=I/T2026.05 | 68.2 | — | — | |
| M2-EncoderModel scale=1B, Zero-shot evaluation=true2024.01 | 67.4 | 87.7 | 93.2 | |
| OpenCLIPModel scale=1.3B, Zero-shot evaluation=true2024.01 | 67.3 | 86.9 | 92.6 | |
| OpenCLIPModel scale=2.5B, Zero-shot evaluation=true2024.01 | 67.3 | 86.9 | 92.6 | |
| BEiT-3Example=21M2023.06 | 67.2 | 87.7 | 92.8 | |
| Meta CLIP 2Backbone=ViT-H/14, Evaluation Protocol=Zero-shot2025.10 | 66.8 | — | — | |
| BEIT3Model scale=0.7B, Zero-shot evaluation=true2024.01 | 66.4 | 86 | 91.8 | |
| TuneCLIPBase Model=SigLIP ViT-B/162026.01 | 66.36 | — | — | |
| CoCaModel scale=2.1B, Zero-shot evaluation=true2024.01 | 66.3 | 86.2 | 91.8 | |
| BaselineBase Model=SigLIP ViT-B/162026.01 | 65.74 | — | — | |
| mPLUG-2Example=417M2023.06 | 65.7 | 87.1 | 92.6 | |
| UNITERTraining Protocol=full fine-tuning, # Tunable=330M2023.05 | 65.7 | 88.6 | 93.8 | |
| UNITER# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 65.7 | 88.6 | 93.8 | |
| CoCaModel scale=0.8B, Zero-shot evaluation=true2024.01 | 65.4 | 85.6 | 91.4 | |
| BLIPExample=129M2023.06 | 65.1 | 86.3 | 91.8 | |
| FlorenceModel scale=0.9B, Zero-shot evaluation=true2024.01 | 64.7 | 85.9 | — | |
| UMG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 64.7 | — | — | |
| COSMOSTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 64.5 | 86.1 | 91.8 | |
| COSMOSTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 64.3 | 86.5 | 92 | |
| EVA-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 64.2 | — | — | |
| FG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 64.1 | — | — | |
| CoCaModel scale=0.4B, Zero-shot evaluation=true2024.01 | 63.8 | 84.7 | 90.7 | |
| DiNO-v3.txtEncoder=ViT-7B, Parameter Count=7B, Zero-Shot evaluation=true2026.02 | 63.7 | — | — | |
| xCLIPZero-shot=true, Backbone=ViT-B/16, Pre-trained=IT35M2022.10 | 63.3 | 87.5 | 94.1 | |
| FlorenceExample=900M2023.06 | 63.2 | 85.7 | — | |
| ERNIE-ViL 2.0Zero-shot evaluation=true2024.01 | 63.1 | 85.7 | 91.4 | |
| Long-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 62.8 | — | — | |
| M2-EncoderModel scale=0.4B, Zero-shot evaluation=true2024.01 | 62.5 | 86.4 | 92.7 | |
| SAIL-L-NV2Pre-training Data=23M Merged, Model Architecture=ViT-L/142024.12 | 62.4 | — | — | |
| LOUPEzero-shot=true, Pre-training data=240M2022.08 | 62.3 | 85.1 | 91.2 | |
| EVAModel scale=1.1B, Zero-shot evaluation=true2024.01 | 61.8 | 83.3 | 90 | |
| VALORExample=433.5M2023.06 | 61.4 | 84.4 | 90.9 | |
| FILIPzero-shot=true, Pre-training data=340M2022.08 | 61.3 | 84.3 | 90.4 | |
| FILIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 61.3 | 84.3 | 90.4 | |
| ALIGNExample=1.8B2023.06 | 59.9 | 83.3 | 89.8 | |
| TuneCLIPBase Model=OpenAI ViT-B/162026.01 | 59.78 | — | — | |
| CLIP-LPre-training Data=LAION400M, Model Architecture=ViT-L/142024.12 | 59.7 | — | — | |
| COSMOSTraining Data=CC12M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 59.6 | 82.3 | 89.4 | |
| SigLIPTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 59.5 | 83.3 | 90.1 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-trained=IT35M2022.10 | 59.4 | 85.2 | 91.9 | |
| CLIPTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 59.3 | 83.1 | 89.9 | |
| EVA-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 58.7 | — | — | |
| ALIGNzero-shot=true, Pre-training data=1800M2022.08 | 58.6 | 83 | 89.7 | |
| ALIGNModel scale=0.8B, Zero-shot evaluation=true2024.01 | 58.6 | 83 | 89.7 | |
| AltCLIPModel scale=0.8B, Zero-shot evaluation=true2024.01 | 58.6 | 80.6 | 87.8 | |
| CLIPzero-shot=true, Pre-training data=400M2022.08 | 58.4 | 81.5 | 88.1 | |
| CLIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 58.4 | 81.5 | 88.1 | |
| DreamLIP*Training Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 58.3 | 81.6 | 88.8 | |
| CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 58 | — | — | |
| TuneCLIPBase Model=LAION ViT-B/322026.01 | 57.8 | — | — | |
| Long-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 57.6 | — | — | |
| SAIL-B-NV2Pre-training Data=CC12M, Model Architecture=ViT-B/16, Patch Size=142024.12 | 57.3 | — | — | |
| SAIL-L-NV2Pre-training Data=CC12M, Model Architecture=ViT-L/142024.12 | 57.3 | — | — | |
| CLIPTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 56.7 | 81.6 | 88.6 | |
| OpenCLIPTraining Data=LAION-2B, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 56.6 | 80.3 | 87.4 | |
| BaselineBase Model=LAION ViT-B/322026.01 | 56.32 | — | — | |
| SigLIPTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 56.3 | 82 | 89 | |
| TuneCLIPBase Model=OpenAI ViT-B/322026.01 | 56.16 | — | — |