Image-to-Text Retrieval on COCO 27 (val)
97.1Matching AccuracyCosine Similarity*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Cosine Similarity*Vision Model=CLIP [40]2024.01 | 97.1 | 98.5 | |
| QAPVision Model=CLIP-V [40]2024.01 | 72.8 | — | |
| Linear regressionVision Model=CLIP-V [40]2024.01 | 72.6 | 83.9 | |
| Local CKAVision Model=CLIP-V [40]2024.01 | 71.9 | 80.5 | |
| QAPVision Model=DINOv2 [37]2024.01 | 65.9 | — | |
| QAPVision Model=ConvNeXt [47]2024.01 | 65.1 | — | |
| Local CKAVision Model=DINOv2 [37]2024.01 | 64.3 | 76 | |
| Local CKAVision Model=ConvNeXt [47]2024.01 | 63.8 | 74.3 | |
| Relative representationsVision Model=CLIP-V [40]2024.01 | 61.6 | 2.9 | |
| Linear regressionVision Model=DINOv2 [37]2024.01 | 56.2 | 75.9 | |
| Relative representationsVision Model=DINOv2 [37]2024.01 | 47.7 | 43.7 | |
| Linear regressionVision Model=ConvNeXt [47]2024.01 | 43.8 | 65.7 | |
| Relative representationsVision Model=ConvNeXt [47]2024.01 | 38.6 | 12.9 |