Image Matching on COCO (val)
80.9Matching AccuracyCLIP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLIPLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 80.9 | 0.567 | |
| Relative representationsLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 52.5 | — | |
| QAP MatchingLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 51.3 | 0.646 | |
| CLIPLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 50.8 | 0.477 | |
| CLIPLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 50.4 | 0.471 | |
| CLIPLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 43.5 | 0.472 | |
| CLIPLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 41.9 | 0.472 | |
| QAP MatchingLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 40.9 | 0.634 | |
| QAP MatchingLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 40.3 | 0.624 | |
| QAP MatchingLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 40 | 0.642 | |
| QAP MatchingLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 39.9 | 0.641 | |
| QAP MatchingLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 39.7 | 0.627 | |
| QAP MatchingLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 38.9 | 0.624 | |
| QAP MatchingLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 38.7 | 0.638 | |
| QAP MatchingLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 38.7 | — | |
| Relative representationsLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 37.8 | — | |
| Relative representationsLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 37.5 | — | |
| Relative representationsLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 37.2 | — | |
| Relative representationsLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 36.6 | — | |
| Relative representationsLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 36.5 | — | |
| Relative representationsLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 36.3 | — | |
| Relative representationsLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 35.8 | — | |
| Relative representationsLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 35 | — | |
| QAP MatchingLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 34.8 | 0.632 | |
| Relative representationsLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 31.8 | — | |
| QAP MatchingLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 31.3 | 0.62 | |
| Relative representationsLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 30.4 | — | |
| QAP MatchingLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 30.2 | 0.598 | |
| Relative representationsLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 28.3 | — | |
| CLIPLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 27.4 | — | |
| Linear regressionLanguage=en, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 25.6 | — | |
| Linear regressionLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 21 | — | |
| Linear regressionLanguage=es, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 19.7 | — | |
| Linear regressionLanguage=it, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 19.7 | — | |
| Linear regressionLanguage=de, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 19.3 | — | |
| Linear regressionLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 19.2 | — | |
| Linear regressionLanguage=Avg., Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 18.9 | — | |
| Linear regressionLanguage=fr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 18.8 | — | |
| Linear regressionLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 18.7 | — | |
| Linear regressionLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 16.3 | — | |
| Linear regressionLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 15.3 | — | |
| Linear regressionLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 15.2 | — | |
| CLIPLanguage=jp, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 12.9 | 0.337 | |
| CLIPLanguage=pl, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 8.1 | 0.261 | |
| CLIPLanguage=tr, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 7.8 | 0.301 | |
| CLIPLanguage=zh, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 2.4 | 0.133 | |
| CLIPLanguage=ru, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 1.7 | 0.077 | |
| CLIPLanguage=ko, Vision Model=CLIP ViT-L, Text Model=paraphrase-multilingual-mpnet-base-v22024.01 | 0.9 | 0.154 |