Image-text Retrieval on MSCOCO (test)
95.6EN Retrieval ScoreCCLM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CCLMSize=large, Fine-tune setting=all-language2022.06 | 95.6 | 94 | 96.1 | — | — | |
| CCLMSize=base, Fine-tune setting=all-language2022.06 | 95.4 | 93.2 | 95.7 | — | — | |
| X2-VLMMultilingual Multimodal Pretraining=false, Size=large2022.11 | 95.3 | 93.3 | 95.6 | — | — | |
| X2-VLMMultilingual Multimodal Pretraining=false, Size=base2022.11 | 94.9 | 93 | 95.2 | — | — | |
| CCLMMultilingual Multimodal Pretraining=true2022.11 | 94.1 | 93 | 94.3 | — | — | |
| CCLMPre-training data=3M, Fine-tune setting=all-language2022.06 | 93.1 | 92.2 | 93.2 | — | — | |
| MURALSize=large, Fine-tune setting=all-language2022.06 | 92.3 | — | 91.6 | — | — | |
| MURALMultilingual Multimodal Pretraining=true, Size=large2022.11 | 92.3 | — | 91.6 | — | — | |
| M3PFine-tuning Strategy=All-Language Fine-tune2021.04 | 88.7 | 86.2 | 87.9 | 82.8 | — | |
| M3PFine-tune setting=all-language2022.06 | 88.7 | 86.2 | 87.9 | — | — | |
| M3PMultilingual Multimodal Pretraining=true2022.11 | 88.7 | 86.2 | 87.9 | — | — | |
| M3PFine-tuning Strategy=English-only Fine-tune2021.04 | 88.6 | 53.8 | 56 | 60.7 | — | |
| M3PFine-tuning Strategy=Single-Language Fine-tune2021.04 | 88.6 | 75.8 | 80.1 | 78 | — | |
| MURALSize=base, Fine-tune setting=all-language2022.06 | 88.6 | — | 88.4 | — | — | |
| MURALMultilingual Multimodal Pretraining=true, Size=base2022.11 | 88.6 | — | 88.4 | — | — | |
| UNITERccFine-tuning Strategy=Translate-Test2021.04 | 88.4 | 87.3 | 82.2 | 84.1 | — | |
| UC2Fine-tuning Strategy=English-only Fine-tune2021.04 | 88.1 | 82 | 71.7 | 78 | — | |
| UC2Fine-tuning Strategy=Single-Language Fine-tune2021.04 | 88.1 | 84.9 | 87.3 | 83.3 | — | |
| UC2Fine-tuning Strategy=All-Language Fine-tune2021.04 | 88.1 | 89.8 | 87.5 | 86.2 | — | |
| UC2Fine-tune setting=all-language2022.06 | 88.1 | 89.8 | 87.5 | — | — | |
| UC2Multilingual Multimodal Pretraining=true2022.11 | 88.1 | 89.8 | 87.5 | — | — | |
| SMALRFine-tuning Strategy=SOTA without pre-training, Dataset Split=Different dev/test splits2021.04 | 81.5 | 77.5 | 76.7 | 73 | — | |
| CCLM-base-3MSetting=Zero-shot, Metric=Average Recall@K (K=1, 5, 10)2022.06 | 81.5 | 79.5 | 76.8 | — | — | |
| S-LIWEFine-tuning Strategy=SOTA without pre-training2021.04 | 80.9 | 73.6 | 70 | 70.8 | — | |
| MURAL-baseSetting=Zero-shot, Metric=Average Recall@K (K=1, 5, 10)2022.06 | 79.2 | — | 73.4 | — | — | |
| MULEFine-tuning Strategy=SOTA without pre-training, Dataset Split=Different dev/test splits2021.04 | 79 | 75.9 | 75.6 | 69.3 | — | |
| PAR.EmbNFine-tuning Strategy=SOTA without pre-training2021.04 | 78.3 | 76 | 74.8 | 67.9 | — | |
| EmbNFine-tuning Strategy=SOTA without pre-training2021.04 | 76.8 | 73.2 | 73.5 | 65.3 | — | |
| C2LIPMethod Category=Models fine-tuned by us2026.03 | — | — | — | — | 82.7 | |
| CE-CLIPMethod Category=Composition-aware models2026.03 | — | — | — | — | 71.9 | |
| CLICMethod Category=Composition-aware models2026.03 | — | — | — | — | 67.4 | |
| CLIP (OpenAI)Backbone=ViT-B/322026.03 | — | — | — | — | 65.4 | |
| CLIP (OpenAI)Backbone=ViT-B/162026.03 | — | — | — | — | 67.6 | |
| Codebook-CLIPMethod Category=Codebook-based models2026.03 | — | — | — | — | 0.1 | |
| CoN-CLIPMethod Category=Composition-aware models2026.03 | — | — | — | — | 61.2 | |
| DAC-LLMMethod Category=Composition-aware models2026.03 | — | — | — | — | 59 | |
| DAC-SAMMethod Category=Composition-aware models2026.03 | — | — | — | — | 58.8 | |
| DreamLIP-3mMethod Category=Fine-grained models2026.03 | — | — | — | — | 61.2 | |
| FG-CLIPMethod Category=Fine-grained models2026.03 | — | — | — | — | 78.4 | |
| FineCLIPMethod Category=Fine-grained models2026.03 | — | — | — | — | 79 | |
| FLAIR-3mMethod Category=Fine-grained models2026.03 | — | — | — | — | 71.5 | |
| IL-CLIPMethod Category=Codebook-based models2026.03 | — | — | — | — | 0.1 | |
| LLIPMethod Category=Fine-grained models2026.03 | — | — | — | — | 67.5 | |
| NegCLIPMethod Category=Composition-aware models2026.03 | — | — | — | — | 73.9 | |
| SigLIPBackbone=ViT-B/162026.03 | — | — | — | — | 78.9 | |
| SigLIPBackbone=ViT-B/16, Fine-tuning Dataset=CC3M, Method Category=Models fine-tuned by us2026.03 | — | — | — | — | 80.3 | |
| SLVC-RMethod Category=Composition-aware models2026.03 | — | — | — | — | 66.9 | |
| SLVC-RLMethod Category=Composition-aware models2026.03 | — | — | — | — | 67 | |
| TripletCLIPMethod Category=Composition-aware models2026.03 | — | — | — | — | 54.4 |