Text-to-Image Retrieval on MSCOCO (test)
84.6R@5X-VLMclip
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| X-VLMclip2022.10 | 84.6 | 61.5 | 90.8 | |
| EfficientVLM2022.10 | 84.4 | 60.6 | 90.5 | |
| X-VLMclipperformance_target=98%2022.10 | 82.9 | 60.3 | 89 | |
| X-VLMsmall2022.10 | 81.6 | 56.1 | 88.7 | |
| OSCARB2022.10 | 80.8 | 54 | 88.5 | |
| OSCARBperformance_target=98%2022.10 | 79.2 | 52.9 | 86.7 | |
| FFF-ViT-B/32Pre-train dataset=Open70M, Zero-shot=true2024.05 | 74.9 | 49.1 | 83.2 | |
| MiniVLM2022.10 | 74.1 | 45 | 84 | |
| DistillVLM2022.10 | 73.7 | 43.9 | 83.3 | |
| ViLT2022.10 | 72.9 | 42.7 | 83.1 | |
| FFF-ViT-B/32Pre-train dataset=Open30M, Zero-shot=true2024.05 | 72.6 | 46.4 | 81.6 | |
| FFF-ViT-B/32Pre-train dataset=YFCC-15M, Zero-shot=true2024.05 | 70.9 | 44.3 | 80.1 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 69.6 | 44.5 | 79.9 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 69.2 | 44.2 | 78.4 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 66.6 | 41.3 | 76.1 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Mode=Zero-shot2024.07 | 60.7 | 35.8 | 70.7 | |
| TripletCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 28.5 | — | — | |
| NegCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 23.11 | — | — | |
| NegCLIP++Training Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 22.69 | — | — | |
| LaCLIPTraining Dataset=CC12M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 19.78 | — | — | |
| TripletCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 11.28 | — | — | |
| LaCLIP + HNTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 8.64 | — | — | |
| NegCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 6.61 | — | — | |
| NegCLIP++Training Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 6.19 | — | — | |
| LaCLIPTraining Dataset=CC3M, Evaluation Protocol=Zero-shot, Backbone=ViT-B/322024.11 | 5.97 | — | — |