Text-to-image retrieval on MSCOCO
64.3R@1BLIP
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| BLIPTraining Protocol=full fine-tuning, # Tunable=223M2023.05 | 64.3 | 85.7 | 91.5 | — | — | |
| BLIP# Tunable=223M, Fine-tuning strategy=full fine-tuning2025.12 | 64.3 | 85.7 | 91.5 | — | — | |
| AuroraTraining Protocol=frozen backbone, # Tunable=0.2M, Rank (r)=1282023.05 | 62.8 | 84.8 | 91 | — | — | |
| Null-LoRA# Tunable=6.0M, Fine-tuning strategy=frozen backbone2025.12 | 62.7 | 84.9 | 91.1 | — | — | |
| UniAdapterTraining Protocol=frozen backbone, # Tunable=18.8M, Rank (r)=5122023.05 | 62.6 | 84.6 | 90.9 | — | — | |
| UniAdapter (r=512)# Tunable=19.5M, Fine-tuning strategy=frozen backbone, rank=5122025.12 | 62.5 | 85 | 91 | — | — | |
| AuroraTraining Protocol=frozen backbone, # Tunable=0.1M, Rank (r)=642023.05 | 62.4 | 84.5 | 91 | — | — | |
| UniAdapterTraining Protocol=frozen backbone, # Tunable=4.6M, Rank (r)=1282023.05 | 62.3 | 84.5 | 90.8 | — | — | |
| LoRATraining Protocol=frozen backbone, # Tunable=10.6M, Rank (r)=322023.05 | 62.1 | 84.4 | 90.6 | — | — | |
| Aurora (r=64)# Tunable=0.6M, Fine-tuning strategy=frozen backbone, rank=642025.12 | 61.5 | 84 | 90.4 | — | — | |
| DoRA (r=32)# Tunable=10.8M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 61.1 | 83.9 | 90.1 | — | — | |
| ALBEFTraining Protocol=full fine-tuning, # Tunable=210M2023.05 | 60.7 | 84.3 | 90.5 | — | — | |
| ALBEF# Tunable=210M, Fine-tuning strategy=full fine-tuning2025.12 | 60.7 | 84.3 | 90.5 | — | — | |
| LoRA (r=32)# Tunable=10.6M, Fine-tuning strategy=frozen backbone, rank=322025.12 | 60.1 | 82.2 | 89.5 | — | — | |
| ALIGNTraining Protocol=full fine-tuning, # Tunable=820M2023.05 | 59.9 | 83.3 | 89.8 | — | — | |
| ALIGN# Tunable=820M, Fine-tuning strategy=full fine-tuning2025.12 | 59.9 | 83.3 | 89.8 | — | — | |
| FG-CLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 58.6 | — | — | — | — | |
| OSCARTraining Protocol=full fine-tuning, # Tunable=330M2023.05 | 57.5 | 82.8 | 89.8 | — | — | |
| UMG-CLIPModel scale=5B, Zero-shot evaluation=true2024.01 | 57.5 | 80.4 | 87.3 | — | — | |
| OSCAR# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 57.5 | 82.8 | 89.8 | — | — | |
| PE-LEncoder=ViTL-162026.02 | 57.1 | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 56.7 | — | — | — | — | |
| M2-EncoderModel scale=10B, Zero-shot evaluation=true2024.01 | 56.5 | 81.6 | 88.8 | — | — | |
| SigLIP 2Backbone=ViT-So/16, Evaluation Protocol=Zero-shot2025.10 | 55.8 | — | — | — | — | |
| SiGLIPEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 55.3 | — | — | — | — | |
| SigLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 55.2 | — | — | — | — | |
| SigLIP 2Backbone=ViT-L/16, Evaluation Protocol=Zero-shot2025.10 | 55.2 | — | — | — | — | |
| X-Ray VisualEncoder=ViTH, Parameter Count=832M, Zero-Shot evaluation=true2026.02 | 55.11 | — | — | — | — | |
| XRay ModelEncoder=ViTL-162026.02 | 55.06 | — | — | — | — | |
| X-Ray VisualEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 55.06 | — | — | — | — | |
| UMG-CLIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 54.6 | 78.5 | 86.1 | — | — | |
| UMG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 54.6 | — | — | — | — | |
| FG-CLIP 2Backbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 54.5 | — | — | — | — | |
| CLOCBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 54.4 | — | — | — | — | |
| PEEncoder=ViTL, Parameter Count=300M, Zero-Shot evaluation=true2026.02 | 54.21 | — | — | — | — | |
| UNITERTraining Protocol=full fine-tuning, # Tunable=330M2023.05 | 52.9 | 79.9 | 88 | — | — | |
| UNITER# Tunable=330M, Fine-tuning strategy=full fine-tuning2025.12 | 52.9 | 79.9 | 88 | — | — | |
| UMG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 51.6 | — | — | — | — | |
| M2-EncoderModel scale=1B, Zero-shot evaluation=true2024.01 | 51.5 | 76.8 | 85 | — | — | |
| OpenCLIPModel scale=2.5B, Zero-shot evaluation=true2024.01 | 51.4 | 74.9 | 83 | — | — | |
| CoCaModel scale=2.1B, Zero-shot evaluation=true2024.01 | 51.2 | 74.2 | 82 | — | — | |
| EVAModel scale=5.0B, Zero-shot evaluation=true2024.01 | 51.1 | 75 | 82.7 | — | — | |
| FG-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 50.9 | — | — | — | — | |
| LOUPEzero-shot=true, Pre-training data=240M2022.08 | 50.1 | 75.4 | 83.3 | — | — | |
| CoCaModel scale=0.8B, Zero-shot evaluation=true2024.01 | 50.1 | 73.8 | 81.8 | — | — | |
| M2-EncoderModel scale=0.4B, Zero-shot evaluation=true2024.01 | 49 | 76.1 | 85.2 | — | — | |
| OpenCLIPModel scale=1.3B, Zero-shot evaluation=true2024.01 | 48.8 | 73.3 | 81.5 | — | — | |
| SAIL-L-NV2Pre-training Data=23M Merged, Model Architecture=ViT-L/142024.12 | 48.6 | — | — | — | — | |
| COSMOSTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 48.4 | 74.2 | 82.6 | — | — | |
| EVA-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 47.9 | — | — | — | — | |
| BaselineBase Model=SigLIP ViT-B/162026.01 | 47.78 | — | — | — | — | |
| Meta CLIP 2Backbone=ViT-H/14, Evaluation Protocol=Zero-shot2025.10 | 47.7 | — | — | — | — | |
| TuneCLIPBase Model=SigLIP ViT-B/162026.01 | 47.64 | — | — | — | — | |
| CoCaModel scale=0.4B, Zero-shot evaluation=true2024.01 | 47.5 | 72.4 | 80.9 | — | — | |
| FlorenceModel scale=0.9B, Zero-shot evaluation=true2024.01 | 47.2 | 71.4 | — | — | — | |
| Long-CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 46.3 | — | — | — | — | |
| ERNIE-ViL 2.0Zero-shot evaluation=true2024.01 | 46 | 71.4 | 80.4 | — | — | |
| COSMOSTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 46 | 72.2 | 81 | — | — | |
| FILIPzero-shot=true, Pre-training data=340M2022.08 | 45.9 | 70.6 | 79.3 | — | — | |
| FILIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 45.9 | 70.6 | 79.3 | — | — | |
| DataCompTraining Phase=Pre-training2024.06 | 45.7 | — | — | — | — | |
| ALIGNzero-shot=true, Pre-training data=1800M2022.08 | 45.6 | 69.8 | 78.6 | — | — | |
| ALIGNModel scale=0.8B, Zero-shot evaluation=true2024.01 | 45.6 | 69.8 | 78.6 | — | — | |
| DiNO-v3.txtEncoder=ViT-7B, Parameter Count=7B, Zero-Shot evaluation=true2026.02 | 45.6 | — | — | — | — | |
| FG-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 45.4 | — | — | — | — | |
| SAIL-B-NV2Pre-training Data=CC12M, Model Architecture=ViT-B/16, Patch Size=142024.12 | 45.3 | — | — | — | — | |
| SAIL-L-NV2Pre-training Data=CC12M, Model Architecture=ViT-L/142024.12 | 45.3 | — | — | — | — | |
| DataComp + RLFTTraining Phase=Alignment fine-tuning2024.06 | 45.1 | — | — | — | — | |
| EVAModel scale=1.1B, Zero-shot evaluation=true2024.01 | 44.1 | 68.5 | 77.3 | — | — | |
| SigLIPTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 43.8 | 70.1 | 79.6 | — | — | |
| COSMOSTraining Data=CC12M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 43 | 69.5 | 78.9 | — | — | |
| CLIP-LPre-training Data=LAION400M, Model Architecture=ViT-L/142024.12 | 43 | — | — | — | — | |
| AltCLIPModel scale=0.8B, Zero-shot evaluation=true2024.01 | 42.9 | 68 | 77.4 | — | — | |
| CLIPTraining Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 42.8 | 69.3 | 79 | — | — | |
| SAIL-L-GTEPre-training Data=23M Merged, Model Architecture=ViT-L/142024.12 | 42.7 | — | — | — | — | |
| EVA-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 41.6 | — | — | — | — | |
| DreamLIPPre-training Data=CC12M, Model Architecture=ViT-B/162024.12 | 41.2 | — | — | — | — | |
| DreamLIP*Training Data=Merged-30M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 41.1 | 67 | 76.6 | — | — | |
| TuneCLIPBase Model=OpenAI ViT-B/162026.01 | 40.45 | — | — | — | — | |
| Long-CLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 40.4 | — | — | — | — | |
| Ours-PTTraining Phase=Pre-training2024.06 | 40.2 | — | — | — | — | |
| Ours-RLFTTraining Phase=Alignment fine-tuning2024.06 | 40.2 | — | — | — | — | |
| FineCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot2025.10 | 40.2 | — | — | — | — | |
| CLIPTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 40.1 | 66.8 | 76.6 | — | — | |
| SigLIPTraining Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 40 | 66.7 | 76.9 | — | — | |
| DreamLIP*Training Data=YFCC15M, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 39.8 | 66 | 75.5 | — | — | |
| TuneCLIPBase Model=LAION ViT-B/322026.01 | 39.55 | — | — | — | — | |
| BaselineBase Model=LAION ViT-B/322026.01 | 39.34 | — | — | — | — | |
| SAIL-L-GTEPre-training Data=CC12M, Model Architecture=ViT-L/142024.12 | 39.3 | — | — | — | — | |
| OpenCLIPTraining Data=LAION-2B, Vision encoder architecture=ViT-B/32, Zero-shot=true2024.12 | 38.8 | 64.8 | 74.7 | — | — | |
| xCLIPZero-shot=true, Backbone=ViT-B/16, Pre-trained=IT35M2022.10 | 38.4 | 66 | 76.7 | — | — | |
| FLAVAModel scale=0.3B, Zero-shot evaluation=true2024.01 | 38.4 | — | 67.5 | — | — | |
| OpenCLIPBase Model=LAION ViT-B/322026.01 | 38.34 | — | — | — | — | |
| CLIP-BPre-training Data=LAION400M, Model Architecture=ViT-B/162024.12 | 38.3 | — | — | — | — | |
| CLIP + RLFTTraining Phase=Alignment fine-tuning2024.06 | 38.1 | — | — | — | — | |
| SAIL-B-GTEPre-training Data=CC12M, Model Architecture=ViT-B/16, Patch Size=142024.12 | 37.9 | — | — | — | — | |
| CLIPzero-shot=true, Pre-training data=400M2022.08 | 37.8 | 62.4 | 72.2 | — | — | |
| CLIPModel scale=0.4B, Zero-shot evaluation=true2024.01 | 37.8 | 62.4 | 72.2 | — | — | |
| CLIPTraining Phase=Pre-training2024.06 | 37.8 | — | — | — | — | |
| CLIPBackbone=ViT-L/14, Evaluation Protocol=Zero-shot2025.10 | 37.1 | — | — | — | — |