Image-Text Retrieval on LVIS
22Recall@1CLIP-ViT-L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIP-ViT-L/14Single Feature=No, Input=CC@102022.08 | 22 | |
| InternVL-C (MLLM)Single Feature=Yes, Input=Full Image2022.08 | 16.81 | |
| DetailCLIP-ViT-L/14Single Feature=Yes, Input=CC@102022.08 | 15.29 | |
| CLIP-ViT-L/14Single Feature=Yes, Input=Full Image2022.08 | 15.12 | |
| GLIP (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 13.75 | |
| BLIP2 (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 13.36 | |
| MDETR (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 12.24 | |
| RegionCLIP (detector-based)Single Feature=Yes, Input=Full Image2022.08 | 10.13 | |
| SLIP (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 9.65 | |
| CLIP-ViT-B/16Single Feature=No, Input=CC@102022.08 | 9.4 | |
| DetailCLIP-ViT-B/16Single Feature=Yes, Input=CC@102022.08 | 7.66 | |
| CLIP-ViT-B/16Single Feature=Yes, Input=Full Image2022.08 | 7.49 |