Text-to-Image Retrieval on DOCCI-CN
84Recall@1FG-CLIP 2
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIP 2Backbone=ViT-So/162025.10 | 84 | |
| FG-CLIP 2Backbone=ViT-L/162025.10 | 81.9 | |
| Meta CLIP 2Backbone=ViT-H/142025.10 | 77.2 | |
| FG-CLIP 2Backbone=ViT-B/162025.10 | 75.4 | |
| Chinese-CLIPBackbone=ViT-L/142025.10 | 50.8 | |
| R2D2Backbone=ViT-L/142025.10 | 46.3 | |
| Chinese-CLIPBackbone=ViT-B/162025.10 | 43.1 | |
| R2D2Backbone=ViT-B/162025.10 | 36.9 | |
| SigLIP 2Backbone=ViT-L/162025.10 | 27.3 | |
| SigLIP 2Backbone=ViT-So/162025.10 | 21.3 | |
| SigLIP 2Backbone=ViT-B/162025.10 | 5.7 |