Object Detection on COCO-OVD
54.7Novel AP50DetCLIPv3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DetCLIPv3Pre-train=FILIP, Qformer, BERT, CLIP, Training=O365, GoldG, V3Det, GranuCap50M, GranuCap600K, CLIP, InstructBLIP, GPT-4, LLaVA, Backbone=Swin-T2023.11 | 54.7 | 42.8 | 46.9 | |
| Cooperative Foundational ModelsPre-train=GDINO (O365,GoldG,Cap4M), SAM (SA-1B), CLIP, Training=COCO, Backbone=ResNet1012023.11 | 50.3 | 49.8 | 49.9 | |
| Cooperative Foundational ModelsPre-train=GDINO (O365,GoldG,Cap4M), SAM (SA-1B), CLIP, Training=COCO, Backbone=ResNet502023.11 | 49.6 | 42.4 | 44.3 | |
| CORA+Training=COCO, COCO Captions, CLIP, Backbone=ResNet50x42023.11 | 43.1 | 60.9 | 56.2 | |
| BARONPre-train=SOCO dataset, MAVL, Training=COCO, COCO Captions, CLIP, Backbone=ResNet50-C42023.11 | 42.7 | 54.9 | 51.7 | |
| Rasheed et al.Pre-train=MAVL (Flickr30k, COCO, Visual Genome), Training=COCO, COCO Captions, CLIP, Backbone=ResNet502023.11 | 36.6 | 54 | 49.4 | |
| CORATraining=COCO, CLIP, Backbone=ResNet502023.11 | 35.1 | 35.5 | 35.4 | |
| BARONPre-train=SOCO dataset, Training=COCO, CLIP, Backbone=ResNet502023.11 | 34 | 60.4 | 53.5 | |
| OV-DETRTraining=COCO, CLIP, Backbone=ResNet50-C42023.11 | 29.4 | 61 | 52.7 | |
| DeticPre-train=ImageNet-21K, Training=COCO, ImageNet-21K, Conceptual Captions, CLIP, Backbone=ResNet502023.11 | 27.8 | 47.1 | 45 | |
| ViLDTraining=COCO, CLIP, Backbone=ResNet502023.11 | 27.6 | 59.5 | 51.3 | |
| OVR-CNNPre-train=COCO Captions, BERT (BooksCorpus, English Wikipedia), Training=COCO, Backbone=ResNet502023.11 | 22.8 | 46 | 39.9 |