Image-to-Text Retrieval on MSCOCO (test)
94.5R@5X-VLMclip
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| X-VLMclip2022.10 | 94.5 | 79 | 97.9 | — | |
| EfficientVLM2022.10 | 94.5 | 78.7 | 97.5 | — | |
| BLIP2023.01 | 93.8 | 75.76 | 96.62 | 266.18 | |
| HADA2023.01 | 92.98 | 75.36 | 96.44 | 264.78 | |
| X-VLMclipperformance_target=98%2022.10 | 92.6 | 77.4 | 95.9 | — | |
| X-VLMsmall2022.10 | 92.3 | 74.5 | 96 | — | |
| OSCARB2022.10 | 91.1 | 70 | 95.5 | — | |
| OSCARBperformance_target=98%2022.10 | 89.3 | 68.6 | 93.6 | — | |
| FFF-ViT-B/32Pre-train dataset=Open70M, Zero-shot=true2024.05 | 86.6 | 66.6 | 91.6 | — | |
| ViLT2022.10 | 86.3 | 61.5 | 92.7 | — | |
| FFF-ViT-B/32Pre-train dataset=Open30M, Zero-shot=true2024.05 | 85.8 | 64.2 | 91.7 | — | |
| MiniVLM2022.10 | 85.1 | 58.8 | 91.7 | — | |
| FFF-ViT-B/32Pre-train dataset=YFCC-15M, Zero-shot=true2024.05 | 84.5 | 61.7 | 90.4 | — | |
| DistillVLM2022.10 | 84.1 | 58.3 | 91.3 | — | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 83.2 | 60.8 | 91.3 | — | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 82.6 | 60.2 | 89.9 | — | |
| UPopTraining Dataset=MSCOCO, Params (img + text)=280.2M2026.02 | 82.4 | 56.1 | 90.2 | — | |
| CLIP2023.01 | 81.22 | 57.84 | 87.78 | 226.84 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 80.6 | 58 | 88.1 | — | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 79.8 | 56.2 | 86.4 | — | |
| CLIP-Map-baseTraining Dataset=YFCC15M, Params (img + text)=39M + 19M2026.02 | 78.8 | 55.1 | 86.5 | — | |
| DynaCLIPTraining Dataset=CC3M, Params (img + text)=86M + 42M2026.02 | 75.5 | 51.3 | 84.6 | — | |
| EfficientVLMTraining Dataset=CC3M, Params (img + text)=152M + 42M2026.02 | 71.7 | 46.6 | 81.3 | — | |
| CLIP-Map-smallTraining Dataset=YFCC15M, Params (img + text)=8M + 3M2026.02 | 64.6 | 38.4 | 74.4 | — | |
| TripletCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 33 | — | — | — | |
| NegCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 30.16 | — | — | — | |
| NegCLIP++Training Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 26.96 | — | — | — | |
| LaCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 25.86 | — | — | — | |
| TripletCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 10.38 | — | — | — | |
| LaCLIP + HNTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 8.08 | — | — | — | |
| NegCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 6.32 | — | — | — | |
| NegCLIP++Training Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 5.8 | — | — | — | |
| LaCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 5.06 | — | — | — |