Multimodal Retrieval on MS COCO Karpathy (test)
47.3Recall@1Multimodal Fusion
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 47.3 | 71.2 | 79.9 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 46.1 | 70.2 | 78.9 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 45.6 | 69.3 | 78 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.5)2026.04 | 44.6 | 70 | 79.5 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 43.9 | 69 | 78 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 42.6 | 67.2 | 77 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 42.3 | 68.2 | 77.6 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 42.1 | 66.9 | 76.5 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 41.9 | 67.7 | 77.4 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Image2026.04 | 41.8 | 65.4 | 74.5 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Image2026.04 | 41.8 | 65.4 | 74.5 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 41.8 | 65.4 | 74.5 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Image2026.04 | 36.5 | 61.1 | 71.1 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Image2026.04 | 36.5 | 61.1 | 71.1 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 36.5 | 61.1 | 71.1 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 36 | 61.3 | 71.9 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 36 | 61.3 | 71.9 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 36 | 61.3 | 71.9 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Image2026.04 | 35.9 | 61.8 | 72.2 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Image2026.04 | 35.9 | 61.8 | 72.2 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 35.9 | 61.8 | 72.2 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Text2026.04 | 30.9 | 54.7 | 65.2 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Text2026.04 | 30.9 | 54.7 | 65.2 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Text2026.04 | 30.9 | 54.7 | 65.2 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Text2026.04 | 28.8 | 52.2 | 63.3 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Text2026.04 | 28.8 | 52.2 | 63.3 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Text2026.04 | 28.8 | 52.2 | 63.3 |