Image-Text Retrieval on CLEVR-DS
33.46Recall@1DetailCLIP-ViT-L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| DetailCLIP-ViT-L/14Single Feature=Yes, Input=CC@102022.08 | 33.46 | |
| CLIP-ViT-L/14Single Feature=No, Input=CC@102022.08 | 33.21 | |
| InternVL-C (MLLM)Single Feature=Yes, Input=Full Image2022.08 | 22.45 | |
| DetailCLIP-ViT-B/16Single Feature=Yes, Input=CC@102022.08 | 18.09 | |
| BLIP2 (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 17.14 | |
| CLIP-ViT-B/16Single Feature=No, Input=CC@102022.08 | 17.03 | |
| CLIP-ViT-L/14Single Feature=Yes, Input=Full Image2022.08 | 13.81 | |
| GLIP (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 11.84 | |
| RegionCLIP (detector-based)Single Feature=Yes, Input=Full Image2022.08 | 10.98 | |
| MDETR (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 9.82 | |
| SLIP (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 9.51 | |
| CLIP-ViT-B/16Single Feature=Yes, Input=Full Image2022.08 | 8.51 |