Fine-Grained Retrieval on FG-OVD (Medium)
66.6R@1FG-CLIP (w/ hard negatives)
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIP (w/ hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg. + 10M hard negatives, Backbone=ViT-B/16, Region-level supervision=true, Hard negatives training=true2025.12 | 66.6 | |
| β-CLIP (CE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=CE2025.12 | 55.4 | |
| Fine-CLIPData=CC2.5M + 10.4M reg., Backbone=ViT-B/16, Region-level supervision=true2025.12 | 49.8 | |
| FG-CLIP (w/o hard negatives)Data=WIT-400M + LAION-1.6B + GRIT-12M + 40M reg., Backbone=ViT-B/16, Region-level supervision=true, Hard negatives training=false2025.12 | 47.1 | |
| β-CLIP (BCE)Data=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/16, Hierarchy size (K)=36, Balancing parameter (beta)=0.5, Objective=BCE2025.12 | 38.5 | |
| Smart-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 37 | |
| EVA-CLIPData=Merged-2B, Backbone=ViT-B/162025.12 | 30.1 | |
| CLIPData=WIT-400M, Backbone=ViT-B/162025.12 | 23.1 | |
| Long-CLIPData=WIT-400M + ShareGPT4V-1M, Backbone=ViT-B/162025.12 | 18.4 |