Fine-Grained Retrieval on FG-OVD Hard split
46.1R@1FG-CLIP (w/ hard negatives)
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIP (w/ hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg. + 10M hard negatives, Backbone=ViT-B/16, Region-level supervision=true, Hard negatives training=true2025.12 | 46.1 | |
| β-CLIP (CE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=CE2025.12 | 30.9 | |
| Fine-CLIPData=CC2.5M + 10.4M reg., Backbone=ViT-B/16, Region-level supervision=true2025.12 | 26.8 | |
| FG-CLIP (w/o hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg., Backbone=ViT-B/16, Region-level supervision=true, Hard negatives training=false2025.12 | 24.5 | |
| β-CLIP (BCE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=BCE2025.12 | 20.1 | |
| Smart-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 18.9 | |
| EVA-CLIPData=Merged-2B, Backbone=ViT-B/162025.12 | 14 | |
| CLIPData=WIT-400M, Backbone=ViT-B/162025.12 | 12 | |
| Long-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 9.2 |