Fine-Grained Retrieval on FG-OVD (Trivial split)
83.4R@1FG-CLIP (w/ hard negatives)
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIP (w/ hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg. + 10M hard negatives, Backbone=ViT-B/16, Region-level supervision=true, Hard negatives training=true2025.12 | 83.4 | |
| β-CLIP (CE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=CE2025.12 | 80.3 | |
| Fine-CLIPData=CC2.5M + 10.4M reg., Backbone=ViT-B/16, Region-level supervision=true2025.12 | 71.9 | |
| β-CLIP (BCE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=BCE2025.12 | 71.3 | |
| Smart-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 70.1 | |
| CLIPData=WIT-400M, Backbone=ViT-B/162025.12 | 58.5 | |
| EVA-CLIPData=Merged-2B, Backbone=ViT-B/162025.12 | 58.3 | |
| Long-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 51.8 |