Open-vocabulary Object Detection on COCO OVD (Generalized (17 + 48))
43.1Novel AP50CORA+
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CORA+Extra Dataset=COCO Captions [9], Pre-train Model=CLIP (RN50x4), Require Novel Class=X2023.03 | 43.1 | 60.9 | 56.2 | |
| CORAExtra Dataset=-, Pre-train Model=CLIP (RN50x4), Require Novel Class=X2023.03 | 41.7 | 44.5 | 43.8 | |
| RegionCLIPExtra Dataset=CC3M [33], Pre-train Model=CLIP (RN50x4), Require Novel Class=X2023.03 | 39.3 | 61.6 | 55.7 | |
| CORAExtra Dataset=-, Pre-train Model=CLIP (RN50), Require Novel Class=X2023.03 | 35.1 | 35.5 | 35.4 | |
| VL-PLMExtra Dataset=-, Pre-train Model=CLIP (RN50), Require Novel Class=✓2023.03 | 34.4 | 60.2 | 53.5 | |
| MEDetExtra Dataset=COCO Captions [9], Pre-train Model=CLIP (ViT-B/32), Require Novel Class=X2023.03 | 32.6 | 54 | 49.4 | |
| RegionCLIP + APT(v_i)Backbone=ResNet50, Variant=v_i2023.05 | 32.1 | 57.2 | 50 | |
| RegionCLIP + APT(v_i + o_i)Backbone=ResNet50, Variant=v_i + o_i2023.05 | 31.8 | 57.3 | 50.6 | |
| RegionCLIPExtra Dataset=CC3M [33], Pre-train Model=CLIP (RN50), Require Novel Class=X2023.03 | 31.4 | 57.1 | 50.4 | |
| RegionCLIPBackbone=ResNet502023.05 | 31.4 | 57.1 | 50.4 | |
| OV-DETRExtra Dataset=-, Pre-train Model=CLIP (ViT-B/32), Require Novel Class=✓2023.03 | 29.4 | 61 | 52.7 | |
| DeticExtra Dataset=COCO Captions [9], Pre-train Model=CLIP (text encoder), Require Novel Class=X2023.03 | 27.8 | 47.1 | 45 | |
| ViLDExtra Dataset=-, Pre-train Model=CLIP (ViT-B/32), Require Novel Class=✓2023.03 | 27.6 | 59.9 | 51.3 | |
| OVR-CNNExtra Dataset=COCO Captions [9], Pre-train Model=-, Require Novel Class=X2023.03 | 22.8 | 46 | 39.9 |