Text-to-Image Retrieval on Crisscrossed Captions (CxC)
61.8R@1ALIGN
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ALIGN2021.02 | 61.8 | 84.9 | 91.1 | — | |
| VACSRBackbone=CLIP ViT-B/162026.05 | 56.3 | 82.8 | 90.1 | — | |
| PCME++Backbone=CLIP ViT-B/162026.05 | 55.2 | 82 | 89.7 | — | |
| PCMEBackbone=CLIP ViT-B/162026.05 | 53.1 | 80.9 | 88.9 | — | |
| VACSRBackbone=CLIP ViT-B/322026.05 | 51.6 | 79.7 | 88 | — | |
| PCME++Backbone=CLIP ViT-B/322026.05 | 50.1 | 78.5 | 87.1 | — | |
| P2RMBackbone=CLIP ViT-B/162026.05 | 50 | 78.7 | 87.3 | — | |
| P2RMBackbone=CLIP ViT-B/322026.05 | 48.4 | 77.2 | 86.2 | — | |
| DAABackbone=CLIP ViT-B/322026.05 | 48.2 | 76.9 | 86.1 | — | |
| PCMEBackbone=CLIP ViT-B/322026.05 | 48 | 77.3 | 86.4 | — | |
| DE T2T+I2T2021.02 | 41.7 | 72.3 | 83 | — | |
| VSRN2021.02 | 40.1 | 71.1 | 81.5 | — | |
| DE I2T2021.02 | 39.8 | 70.2 | 80.9 | — | |
| VSE++2021.02 | 32.5 | 62.7 | 75.4 | — | |
| DAABackbone=CLIP ViT-B/162026.05 | 24.3 | 50.3 | 62.5 | — | |
| ALIGN2022.09 | — | — | — | 79.2 | |
| DET2T+I2T2022.09 | — | — | — | 65.7 | |
| ERNIE-ViL 2.0training=fine-tuned on COCO2022.09 | — | — | — | 79 |