Text Retrieval on Flickr30k Karpathy (test)
87.9R@1VILLA-large
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VILLA-large2020.06 | 87.9 | 97.5 | 98.8 | |
| UNITER-large2020.06 | 87.3 | 98 | 99.2 | |
| VILLA-base2020.06 | 86.6 | 97.9 | 99.2 | |
| Unicoder-VL2020.06 | 86.2 | 96.3 | 99 | |
| UNITER-base2020.06 | 85.9 | 97.1 | 98.8 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 76.4 | 92.4 | 95.8 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 76.1 | 92.5 | 95.5 | |
| Multimodal FusionImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 75.8 | 92.1 | 95.6 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.7)2026.04 | 72.6 | 91.1 | 95.3 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 72.3 | 91.2 | 95.3 | |
| Multimodal FusionImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 72.2 | 90.8 | 95.2 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Fusion (0.5)2026.04 | 72 | 90.7 | 94.3 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Fusion (0.7)2026.04 | 71.7 | 90.7 | 94.7 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Image2026.04 | 71.7 | 89.2 | 93.3 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Image2026.04 | 71.7 | 89.2 | 93.3 | |
| Visual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 71.7 | 89.2 | 93.3 | |
| Multimodal FusionImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Fusion (0.7)2026.04 | 70.9 | 90.9 | 94.6 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Image2026.04 | 64.7 | 87.1 | 92.1 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Image2026.04 | 64.7 | 87.1 | 92.1 | |
| Visual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 64.7 | 87.1 | 92.1 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Image2026.04 | 62.3 | 85.5 | 91.4 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Image2026.04 | 62.3 | 85.5 | 91.4 | |
| Visual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Image2026.04 | 62.3 | 85.5 | 91.4 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 59.6 | 82.6 | 88.5 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 59.6 | 82.6 | 88.5 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=jina-embeddings-v4, Mode=Text2026.04 | 59.6 | 82.6 | 88.5 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mGTE-base, Mode=Text2026.04 | 55.6 | 79.8 | 86.1 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mGTE-base, Mode=Text2026.04 | 55.6 | 79.8 | 86.1 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mGTE-base, Mode=Text2026.04 | 55.6 | 79.8 | 86.1 | |
| Textual retrievalImage Encoder=CLIP ViT-L/14, Text Encoder=mE5-large, Mode=Text2026.04 | 54.6 | 80.2 | 86.6 | |
| Textual retrievalImage Encoder=MetaCLIP-B/32-400M, Text Encoder=mE5-large, Mode=Text2026.04 | 54.6 | 80.2 | 86.6 | |
| Textual retrievalImage Encoder=SigLIP-so400m-384, Text Encoder=mE5-large, Mode=Text2026.04 | 54.6 | 80.2 | 86.6 |