Fine-grained Image-Text Alignment on FG-OVD
19.24Accuracy (Hard)MulCLIP
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MulCLIPBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 19.24 | 40.73 | 47.57 | 68.89 | 44.11 | |
| GOALBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 18.65 | 39.66 | 44.5 | 72.78 | 43.9 | |
| FineLIPBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 18.17 | 38.68 | 41.96 | 73.79 | 43.15 | |
| W/o WPRBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 17.38 | 38.51 | 45.42 | 68.41 | 42.43 | |
| W/o SAPBackbone=ViT-B/16, Fine-tuning dataset=DOCCI2025.12 | 16.56 | 37.84 | 43.03 | 65.84 | 40.82 |