Image Retrieval on COCO
67Recall@1X-FM base
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| X-FM baseEval=FT, Multi-modal pre-training data size=1.3B2023.01 | 67 | 83.2 | — | |
| X2-VLMEval=FT, Multi-modal pre-training data size=1.3B2023.01 | 66.2 | 80 | — | |
| mPLUG-2 baseEval=FT, Multi-modal pre-training data size=17M2023.01 | 65.3 | 80.1 | — | |
| X-FM baseEval=FT, Multi-modal pre-training data size=4M2023.01 | 64.7 | 82.4 | — | |
| X2-VLMEval=FT, Multi-modal pre-training data size=4M2023.01 | 62.7 | 78.2 | — | |
| X-FM baseEval=ZS, Multi-modal pre-training data size=4M2023.01 | 61.1 | — | — | |
| mPLUG-2 baseEval=ZS, Multi-modal pre-training data size=17M2023.01 | 59.4 | — | — | |
| OmniVLEval=FT, Multi-modal pre-training data size=14M2023.01 | 58.5 | — | — | |
| X2-VLMEval=ZS, Multi-modal pre-training data size=1.3B2023.01 | 58.3 | — | — | |
| X2-VLMEval=ZS, Multi-modal pre-training data size=4M2023.01 | 55.2 | — | — | |
| Uni-PerEval=FT, Multi-modal pre-training data size=30M2023.01 | 52.6 | — | — | |
| OmniVLEval=ZS, Multi-modal pre-training data size=14M2023.01 | 51.6 | — | — | |
| SuperCLIPPretrain=L-12.8B, Zero-shot=true2025.12 | 45.5 | — | — | |
| CLIPPretrain=L-12.8B, Zero-shot=true2025.12 | 43.9 | — | — | |
| UNIMO-2Eval=ZS, Multi-modal pre-training data size=4M2023.01 | 38.4 | — | — | |
| SuperCLIPPretrain=L-512M, Zero-shot=true2025.12 | 35.9 | — | — | |
| CLIPPretrain=L-512M, Zero-shot=true2025.12 | 32.7 | — | — | |
| SuperCLIPPretrain=B-512M, Zero-shot=true2025.12 | 31.3 | — | — | |
| CLIPPretrain=B-512M, Zero-shot=true2025.12 | 29 | — | — | |
| CNX-SModel=CNX-S, Supervision=Unsupervised, Representation=Original2025.10 | — | — | 86.7 | |
| CNX-SModel=CNX-S, Supervision=Supervised, Representation=Original2025.10 | — | — | 86.7 | |
| HashCoderModel=ViT-L, Supervision=Unsupervised, Representation=256-bit Code2025.10 | — | — | 88.3 | |
| HashCoderModel=ViT-B, Supervision=Unsupervised, Representation=256-bit Code2025.10 | — | — | 88.4 | |
| HashCoderModel=CNX-S, Supervision=Unsupervised, Representation=256-bit Code2025.10 | — | — | 87.3 | |
| HashCoderModel=ViT-L, Supervision=Supervised, Representation=256-bit Code2025.10 | — | — | 87.5 | |
| HashCoderModel=ViT-B, Supervision=Supervised, Representation=256-bit Code2025.10 | — | — | 87.8 | |
| HashCoderModel=CNX-S, Supervision=Supervised, Representation=256-bit Code2025.10 | — | — | 86.6 | |
| Random HashCoderModel=ViT-B, Supervision=Random, Representation=256-bit Code2025.10 | — | — | 74.5 | |
| ViT-BModel=ViT-B, Supervision=Random, Representation=Original2025.10 | — | — | 86.6 | |
| ViT-BModel=ViT-B, Supervision=Unsupervised, Representation=Original2025.10 | — | — | 86.6 | |
| ViT-BModel=ViT-B, Supervision=Supervised, Representation=Original2025.10 | — | — | 86.6 | |
| ViT-LModel=ViT-L, Supervision=Unsupervised, Representation=Original2025.10 | — | — | 86.9 | |
| ViT-LModel=ViT-L, Supervision=Supervised, Representation=Original2025.10 | — | — | 86.9 |