Object Detection on OV-COCO
2,940AP50 (Novel)OV-DETR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OV-DETR2022.03 | 2,940 | 52.7 | 61 | |
| ViLD2022.03 | 2,760 | 51.3 | 59.5 | |
| OVR-CNN2022.03 | 2,280 | 46 | 39.9 | |
| ViLD-text2022.03 | 590 | 49.3 | 61.8 | |
| PLZero-shot (no captions/image-text)=true2022.03 | 410 | 27.9 | 35.9 | |
| DELOZero-shot (no captions/image-text)=true2022.03 | 310 | 13 | 13.8 | |
| LLMDet (Tiny) + DetRefinerTraining Data=GroundingCap-1M, DetRefiner=true2026.05 | 61.7 | 56 | 54 | |
| LLMDet (Tiny)Training Data=GroundingCap-1M, DetRefiner=false2026.05 | 61.6 | 55.3 | 53 | |
| MM-Grounding DINO (Tiny) + DetRefinerTraining Data=O365, GoldG, GRIT, V3Det, DetRefiner=true2026.05 | 59.5 | 52.1 | 49.4 | |
| MM-Grounding DINO (Tiny)Training Data=O365, GoldG, GRIT, V3Det, DetRefiner=false2026.05 | 59.3 | 50.8 | 47.8 | |
| Grounding DINO (Tiny) + DetRefinerTraining Data=O365, GoldG, Cap4M, DetRefiner=true2026.05 | 58.1 | 51.3 | 48.9 | |
| Grounding DINO (Tiny)Training Data=O365, GoldG, Cap4M, DetRefiner=false2026.05 | 57.4 | 49.4 | 46.6 | |
| GLIP (Tiny) + DetRefinerTraining Data=O365, GoldG, CC3M, SBU, DetRefiner=true2026.05 | 53.8 | 48.2 | 46.3 | |
| GLIP (Tiny)Training Data=O365, GoldG, CC3M, SBU, DetRefiner=false2026.05 | 53.4 | 46.6 | 44.2 | |
| DeCLIP + NoOVD (Ours)Backbone=ViT-L/14, Training Data=LVIS-base2026.03 | 47.5 | 61 | 65.8 | |
| DST-DetBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 46.7 | 58 | 61.9 | |
| DST-DetBackbone=ViT-L/142026.07 | 46.7 | 58 | 61.9 | |
| DeCLIP + F-ViTBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 46.2 | 60.3 | 65.2 | |
| CLIPSelf + F-ViT + ProCalBackbone=ViT-L/142026.07 | 45.7 | 58.8 | 63.4 | |
| CLIPSelf + NoOVD (Ours)Backbone=ViT-L/14, Training Data=LVIS-base2026.03 | 45.4 | 59.7 | 64.7 | |
| CLIPSelf + NoOVDBackbone=ViT-L/142026.07 | 45.4 | 59.7 | 64.7 | |
| OV-DQUOBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 45.3 | 47.5 | 48.3 | |
| OV-DQUOBackbone=ViT-L/142026.07 | 45.3 | 47.5 | 48.3 | |
| DeCLIP + F-ViT†Backbone=ViT-L/14, Training Data=LVIS-base2026.03 | 45.1 | 60.2 | 65.5 | |
| CLIPSelf + F-ViTBackbone=ViT-L/142026.07 | 44.5 | 59 | 64.2 | |
| F-ViT+CLIPSelf (Region Proposal)Backbone=ViT-L/142023.10 | 44.3 | 59 | 64.1 | |
| CLIPSelf + F-ViTBackbone=ViT-L/14, Training Data=LVIS-base2026.03 | 44.3 | 59 | 64.1 | |
| OursBackbone=ViT-L/14 [29], Detector Architecture=F-ViT [35], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 44 | — | 65.8 | |
| OursBackbone Network=ViT-L/142026.04 | 44 | — | 65.8 | |
| CORA+Backbone=RN50x4, learnable category prompts=true, additional image annotations=true2023.10 | 43.1 | 56.2 | 60.9 | |
| CORA+Backbone=RN50x4, Training Data=LVIS-base + COCO Cap.2026.03 | 43.1 | 56.2 | 60.9 | |
| CORA+Backbone=RN50x42026.07 | 43.1 | 56.2 | 60.9 | |
| CLIPSelf + F-ViT†Backbone=ViT-L/14, Training Data=LVIS-base2026.03 | 42.9 | 59.1 | 64.8 | |
| BARONSupervision=CLIP + Caption, Backbone=ResNet50-C4, Detector=FasterRCNN, MAVL proposals=true2023.02 | 42.7 | 51.7 | 54.9 | |
| BARON-Cap&KDBackbone=RN50, additional image annotations=true2023.10 | 42.7 | 51.7 | 54.9 | |
| BARONBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=Captions [3], Additional Pretrained Models=MViT [22]2026.04 | 42.7 | — | 54.9 | |
| DeCLIP + NoOVD (Ours)Backbone=ViT-B/16, Training Data=LVIS-base2026.03 | 41.9 | 54 | 58.3 | |
| OWL-VITVenue=ECCV 22, Training source=image captions in CB ∪ CN, instance-level labels in CB (use external datasets)2023.10 | 41.8 | 47.2 | 49.1 | |
| CORABackbone=RN50x4, learnable category prompts=true2023.10 | 41.7 | 43.8 | 44.5 | |
| CORABackbone=RN50x4, Training Data=LVIS-base2026.03 | 41.7 | 43.8 | 44.5 | |
| CORABackbone=RN50x42026.07 | 41.7 | 43.8 | 44.5 | |
| DST-DetBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 41.3 | 54.8 | 59.6 | |
| RALFBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=Captions [3], Additional Pretrained Models=MViT [22]2026.04 | 41.3 | — | 54.3 | |
| CLIFFBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=Captions [3], Additional Pretrained Models=MViT [22]2026.04 | 41.3 | — | 54.1 | |
| CLIPSelf†Backbone=ViT-L/14 [29], Detector Architecture=F-ViT [35], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 41.3 | — | 65.5 | |
| CLIPSelf†Backbone Network=ViT-L/142026.04 | 41.3 | — | 65.5 | |
| DST-DetBackbone=ViT-B/162026.07 | 41.3 | 54.8 | 59.6 | |
| DeCLIP + F-ViTBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 41.1 | 53.5 | 57.8 | |
| LP-OVODTraining source=instance-level labels in CB, unknown novel classes during training2023.10 | 40.5 | 55.2 | 60.5 | |
| DeCLIP + F-ViT†Backbone=ViT-B/16, Training Data=LVIS-base2026.03 | 40.3 | 53.4 | 58.1 | |
| CLIPSelf + F-ViT + ProCalBackbone=ViT-B/162026.07 | 40.1 | 50.5 | 54.3 | |
| OV-DQUOBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 39.4 | 41.7 | 42.6 | |
| OV-DQUOBackbone=ViT-B/162026.07 | 39.4 | 41.7 | 42.6 | |
| RegionCLIPBackbone=RN50x42023.10 | 39.3 | 55.7 | 61.6 | |
| RegionCLIPBackbone=RN50x4*, Training Data=CC3M2026.03 | 39.3 | 55.7 | 61.6 | |
| RegionCLIPBackbone=RN50x42026.07 | 39.3 | 55.7 | 61.6 | |
| OursBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 38.9 | — | 59.5 | |
| OursBackbone Network=RN502026.04 | 38.9 | — | 59.5 | |
| F-ViT+Region-TextBackbone=ViT-L/142023.10 | 38.7 | 54.1 | 59.6 | |
| F-ViT+CLIPSelf (Image Patch)Backbone=ViT-L/142023.10 | 38.4 | 54.8 | 60.6 | |
| CLIPSelf + NoOVD (Ours)Backbone=ViT-B/16, Training Data=LVIS-base2026.03 | 37.9 | 51.6 | 56.5 | |
| CLIPSelf + NoOVDBackbone=ViT-B/162026.07 | 37.9 | 51.6 | 56.5 | |
| LBPBenchmark=V-OVD, Detector=Faster R-CNN, batch size 16 optimization=true2024.06 | 37.8 | 53.2 | 58.7 | |
| F-ViT+CLIPSelf (Region Proposal)Backbone=ViT-B/162023.10 | 37.6 | 50.4 | 54.9 | |
| CLIPSelf + F-ViTBackbone=ViT-B/16, Training Data=LVIS-base2026.03 | 37.6 | 50.4 | 54.9 | |
| SAS-DetBackbone=RN50-C4, Training Data=LVIS-base2026.03 | 37.4 | 53 | 58.5 | |
| SAS-DetBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=None, Additional Pretrained Models=RegionCLIP [39]2026.04 | 37.4 | — | 58.5 | |
| SAS-DetBackbone Network=RN502026.04 | 37.4 | — | 58.5 | |
| CLIPSelf + F-ViTBackbone=ViT-B/162026.07 | 37.4 | 50.3 | 54.8 | |
| BARON + CLIMBackbone=RN50, reproduced=true2023.12 | 36.9 | — | — | |
| RKDWTFBackbone=RN50* WTF8x, Training Data=LVIS-base + IN-L2026.03 | 36.9 | 51.5 | 56.6 | |
| Rasheed et al.Supervision=CLIP + Caption, Backbone=ResNet50-C4, Detector=FasterRCNN2023.02 | 36.6 | 49.4 | 54 | |
| OC-OVDBackbone=RN50, additional image annotations=true2023.10 | 36.6 | 49.4 | 54 | |
| Object-centric-OVDBenchmark=WS-OVD, Detector=Faster R-CNN2024.06 | 36.6 | 49.4 | 54 | |
| RKDWTFBackbone=RN50* WTF, Training Data=LVIS-base + IN-L2026.03 | 36.6 | 49.4 | 54 | |
| OC-OVDBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=Captions [3], Additional Pretrained Models=MViT [22]2026.04 | 36.6 | — | 54 | |
| LBPBenchmark=V-OVD, Detector=Faster R-CNN2024.06 | 35.9 | 54.3 | 60.8 | |
| LBPTraining Data=LVIS-base2026.03 | 35.9 | 54.3 | 60.8 | |
| BARONBenchmark=V-OVD, Detector=Faster R-CNN, batch size 16 optimization=true2024.06 | 35.8 | 52.3 | 58.2 | |
| CLIPSelf + F-ViT†Backbone=ViT-B/16, Training Data=LVIS-base2026.03 | 35.8 | 50.6 | 55.8 | |
| DV-DetBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=Captions [3], Additional Pretrained Models=None2026.04 | 35.8 | — | 57 | |
| OADPBackbone=RN502023.12 | 35.6 | — | — | |
| OADPBackbone=RN502023.10 | 35.6 | 50.5 | 55.8 | |
| Detic + CLIMBackbone=RN50, reproduced=true2023.12 | 35.4 | — | — | |
| MarvelOVD†Backbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 35.4 | — | 56.5 | |
| MarvelOVD†Backbone Network=RN502026.04 | 35.4 | — | 56.5 | |
| CORABackbone=RN50, learnable category prompts=true2023.10 | 35.1 | 35.4 | 35.5 | |
| CORABackbone=RN50, Training Data=LVIS-base2026.03 | 35.1 | 35.4 | 35.5 | |
| CORABackbone=RN502026.07 | 35.1 | 35.4 | 35.5 | |
| BARONBackbone=RN50, reproduced=true2023.12 | 34.8 | — | — | |
| F-ViT+Region-TextBackbone=ViT-B/162023.10 | 34.4 | 49 | 54.2 | |
| VL-PLMVenue=ECCV 22, Training source=instance-level labels in CB, known novel classes during training2023.10 | 34.4 | 53.5 | 60.2 | |
| CFM-ViTBackbone=ViT-L/162023.10 | 34.1 | 46 | — | |
| BARONSupervision=CLIP, Backbone=ResNet50-FPN, Detector=FasterRCNN2023.02 | 34 | 53.5 | 60.4 | |
| BARON-KDBackbone=RN502023.10 | 34 | 53.5 | 60.4 | |
| BARONBenchmark=V-OVD, Detector=Faster R-CNN2024.06 | 34 | 53.5 | 60.4 | |
| BARONBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 34 | — | 60.4 | |
| BARONBackbone Network=RN502026.04 | 34 | — | 60.4 | |
| F-ViT+CLIPSelf (Image Patch)Backbone=ViT-B/162023.10 | 33.6 | 48.8 | 54.2 | |
| RALFBackbone=RN50 [9], Detector Architecture=FR-CNN [26], Additional Supervision=None, Additional Pretrained Models=None2026.04 | 33.4 | — | 54.5 |