Image Retrieval on COCO (val)
90.4Recall@5CLIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLIPLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 90.4 | — | |
| ViT-L/14 baselineSparsity=100%2026.01 | 70.1 | 45.5 | |
| ViT-L/14 SparseSparsity=0.66%2026.01 | 68.5 | 43.7 | |
| Local CKA based Retrieval and MatchingLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 66.7 | — | |
| ViT-L/14 Sparse+Sparsity=0.47%2026.01 | 66.4 | 41.8 | |
| CLIPLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 65.9 | — | |
| CLIPLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 63.9 | — | |
| ViT-L/14 OpenAISparsity=100%2026.01 | 61 | 36.5 | |
| Local CKA based Retrieval and MatchingLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 57.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 57.2 | — | |
| Local CKA based Retrieval and MatchingLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 57 | — | |
| Local CKA based Retrieval and MatchingLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 56.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 55.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 55.4 | — | |
| CLIPLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 54.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 53.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 53.7 | — | |
| Local CKA based Retrieval and MatchingLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 53.1 | — | |
| CLIPLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 52.9 | — | |
| Local CKA based Retrieval and MatchingLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 48.6 | — | |
| Local CKA based Retrieval and MatchingLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 48.4 | — | |
| CLIPLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 35.1 | — | |
| CLIPLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 17.8 | — | |
| CLIPLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 15.7 | — | |
| CLIPLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 14.6 | — | |
| CLIPLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 4.8 | — | |
| CLIPLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 3.5 | — | |
| CLIPLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 2.2 | — |