Image-to-text Retrieval on Flickr30K 84 (test)
92.9Recall@1COSMOS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| COSMOSPre-training Data=Merged-30M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 92.9 | 99.4 | 99.9 | |
| COSMOSPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 92.6 | 99.1 | 99.7 | |
| COSMOSPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 91.4 | 98.2 | 98.8 | |
| CLIPPre-training Data=Merged-30M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 90.5 | 98.7 | 99.4 | |
| SigLIPPre-training Data=Merged-30M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 90.5 | 98.3 | 99.4 | |
| LiTPre-training Data=2.5B, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 90.1 | 98.5 | 99.6 | |
| SigLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 89.9 | 97.5 | 98.9 | |
| DreamLIPPre-training Data=Merged-30M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 89.9 | 99 | 99.6 | |
| CLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 89.1 | 97.6 | 98.8 | |
| OpenCLIPPre-training Data=LAION-2B, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 87.6 | 97.7 | 99.5 | |
| DreamLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 87.3 | 98.1 | 99 | |
| OpenCLIPPre-training Data=LAION-400M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 86 | 97.3 | 98.9 | |
| MetaCLIPPre-training Data=2.5B, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 85.9 | 97.3 | 98.9 | |
| OpenCLIPPre-training Data=DataComp-1B, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 84.5 | 96.8 | 98.4 | |
| COSMOSPre-training Data=CC3M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 84.1 | 96.2 | 98.9 | |
| DreamLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 84.1 | 97.8 | 99 | |
| SigLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 82.5 | 96.1 | 97.8 | |
| CLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 81.8 | 96.5 | 98.1 | |
| LaSF-CLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 71.8 | 91.9 | 95.2 | |
| MaskCLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 70.1 | 90.3 | 95.3 | |
| SigLIPPre-training Data=CC3M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 69.8 | 90.4 | 94.5 | |
| DreamLIPPre-training Data=CC3M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 69.2 | 91.5 | 95.9 | |
| SF-CLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 68.7 | 90.4 | 94.8 | |
| CLIPPre-training Data=CC3M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 68.4 | 88.9 | 93.2 | |
| LaCLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 63.9 | 86.5 | 92.6 | |
| MLLM-APre-training Data=CC3M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 63.5 | 86.6 | 91.7 | |
| SLIPPre-training Data=CC12M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 62.5 | 87.2 | 92.1 | |
| SLIPPre-training Data=YFCC15M, Evaluation Protocol=Zero-shot, Vision Encoder Architecture=ViT-B/162024.12 | 58.6 | 85.1 | 91.7 |