Caption Matching and Retrieval on COCO 2014 (val)
97.1Matching AccuracyCosine Similarity
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cosine SimilarityVision Model=CLIP2024.01 | 97.1 | 96.1 | |
| QAPVision Model=CLIP-V2024.01 | 72.3 | — | |
| Local CKAVision Model=CLIP-V2024.01 | 71.9 | 69.9 | |
| QAPVision Model=ConvNeXt2024.01 | 66.1 | — | |
| QAPVision Model=DINOv22024.01 | 66 | — | |
| Local CKAVision Model=ConvNeXt2024.01 | 64.8 | 65.5 | |
| Local CKAVision Model=DINOv22024.01 | 64.3 | 70.5 | |
| Relative representationsVision Model=CLIP-V2024.01 | 61.6 | 41.3 | |
| Relative representationsVision Model=DINOv22024.01 | 47.7 | 52.3 | |
| Linear regressionVision Model=DINOv22024.01 | 45.1 | 65.4 | |
| Linear regressionVision Model=CLIP-V2024.01 | 42.7 | 59.1 | |
| Relative representationsVision Model=ConvNeXt2024.01 | 38.6 | 34.1 | |
| Linear regressionVision Model=ConvNeXt2024.01 | 31.3 | 46.1 |