Image-Text Retrieval on Unity
55.21Recall@1DetailCLIP-ViT-L/14
Evaluation Results
| Method | Links | |
|---|---|---|
| DetailCLIP-ViT-L/14Single Feature=Yes, Input=CC@102022.08 | 55.21 | |
| CLIP-ViT-L/14Single Feature=No, Input=CC@102022.08 | 52.4 | |
| InternVL-C (MLLM)Single Feature=Yes, Input=Full Image2022.08 | 38.93 | |
| CLIP-ViT-L/14Single Feature=Yes, Input=Full Image2022.08 | 35.74 | |
| BLIP2 (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 32.34 | |
| GLIP (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 28.31 | |
| MDETR (detector/grounding-based)Single Feature=Yes, Input=Full Image2022.08 | 25.75 | |
| DetailCLIP-ViT-B/16Single Feature=Yes, Input=CC@102022.08 | 25.02 | |
| CLIP-ViT-B/16Single Feature=Yes, Input=Full Image2022.08 | 24.63 | |
| SLIP (CLIP-like)Single Feature=Yes, Input=Full Image2022.08 | 24.42 | |
| RegionCLIP (detector-based)Single Feature=Yes, Input=Full Image2022.08 | 24.1 | |
| CLIP-ViT-B/16Single Feature=No, Input=CC@102022.08 | 23.11 |