Multimodal Retrieval on Flickr8k Karpathy (test)
71.8Recall@1Multimodal Fusion
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 71.8 | 90.9 | 95.2 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 71.6 | 90.7 | 95.4 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 70.9 | 90.4 | 95.2 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 69 | 90.8 | 95.8 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 68.9 | 91.3 | 95.9 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 68.4 | 90.5 | 95.4 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.5)2026.04 | 67.2 | 90.1 | 95.1 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 66.1 | 89.6 | 95.1 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Image2026.04 | 66.1 | 86.9 | 92.5 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Image2026.04 | 66.1 | 86.9 | 92.5 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 66.1 | 86.9 | 92.5 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 65.6 | 88.9 | 94.4 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Image2026.04 | 61.6 | 86.3 | 92.8 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Image2026.04 | 61.6 | 86.3 | 92.8 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 61.6 | 86.3 | 92.8 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Image2026.04 | 58.1 | 84.1 | 91.2 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Image2026.04 | 58.1 | 84.1 | 91.2 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 58.1 | 84.1 | 91.2 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 56.2 | 82 | 89.6 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 56.2 | 82 | 89.6 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 56.2 | 82 | 89.6 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Text2026.04 | 51.9 | 78.8 | 87.2 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Text2026.04 | 51.9 | 78.8 | 87.2 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Text2026.04 | 51.9 | 78.8 | 87.2 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Text2026.04 | 49.2 | 76.8 | 85.6 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Text2026.04 | 49.2 | 76.8 | 85.6 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Text2026.04 | 49.2 | 76.8 | 85.6 |