Image-Caption Retrieval on XTD
70.7EN ScoreDINOv2-MpNet
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DINOv2-MpNetTraining Data Scope=English-only2024.09 | 70.7 | 60.6 | 60.6 | 45.6 | 52.7 | 58 | |
| ViT-L-14@laion400mTraining Data Scope=English-only, Backbone=ViT-L-14, Data=LAION-400M2024.09 | 64.5 | 26.7 | 38.3 | 1.4 | 1.7 | 26.5 | |
| xlm-roberta-base-ViT-B-32@laion5bTraining Data Scope=Multilingual, Backbone=ViT-B-32, Data=LAION-5B2024.09 | 63.2 | 54.5 | 55.7 | 47.1 | 50.3 | 54.2 | |
| M-CLIP/XLM-Roberta-Large-Vit-B-16PlusTraining Data Scope=Multilingual, Backbone=ViT-B-16Plus2024.09 | 63.2 | 61.4 | 59.3 | 48.3 | 54.8 | 57.4 | |
| nllb-clip-large@v1Training Data Scope=Multilingual2024.09 | 59.9 | 56.5 | 56 | 49.3 | 50.4 | 54.4 | |
| openai/clip-vit-large-patch14Training Data Scope=English-only, Backbone=ViT-L-142024.09 | 59.4 | 19.9 | 28.5 | 4.1 | 1.3 | 22.6 | |
| M-CLIP/XLM-Roberta-Large-Vit-L-14Training Data Scope=Multilingual, Backbone=ViT-L-142024.09 | 56.3 | 52.2 | 51.8 | 41.5 | 48.4 | 50 | |
| M-CLIP/XLM-Roberta-Large-Vit-B-32Training Data Scope=Multilingual, Backbone=ViT-B-322024.09 | 48.5 | 46.9 | 46.1 | 35 | 43.2 | 43.9 | |
| nllb-clip-base@v1Training Data Scope=Multilingual2024.09 | 47.2 | 43.3 | 45 | 37.9 | 40.6 | 42.8 |