Object Detection on OD-LVIS 15 open domains (test)
25.3APfExDet (DeCLIP)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ExDet (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 25.3 | 24.7 | 26.3 | 25.2 | |
| DVtor (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 24.9 | 22.6 | 23.2 | 23.6 | |
| DVtor (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 23.9 | 22.9 | 21.6 | 23.1 | |
| ExDet (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 23.9 | 24.3 | 25.9 | 24.5 | |
| F-ViT (DeCLIP)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 23 | 21.7 | 21.4 | 22.2 | |
| F-ViT (CLIPSelf)Backbone=ViT-L/14, Training Data=LVIS-base2026.06 | 22.5 | 21.3 | 20.2 | 21.6 | |
| OWL-ViTBackbone=ViT-L/14, Training Data=O365 + VG2026.06 | 22.1 | 21.6 | 19.9 | 21.5 | |
| YOLO-WorldBackbone=YOLOv8-L*, Training Data=O365 + GoldG2026.06 | 21.9 | 19.1 | 19.3 | 20.2 | |
| DK-DETRBackbone=RN50, Training Data=LVIS-all2026.06 | 21.1 | 19.4 | 15.3 | 19.4 | |
| MM-OVODBackbone=RN50* (Agg), Training Data=LVIS-base2026.06 | 20.5 | 19.8 | 14 | 19 | |
| MM-OVODBackbone=RN50* (Agg), Training Data=LVIS-base + IN-L2026.06 | 20.4 | 20.4 | 15.9 | 19.6 | |
| RegionCLIPBackbone=RN50x4*, Training Data=CC3M2026.06 | 19.5 | 15.8 | 12.4 | 16.7 | |
| DVtor (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 19.5 | 14.7 | 15.5 | 16.7 | |
| ExDet (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 19.4 | 18.9 | 17.3 | 18.8 | |
| ExDet (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 19.2 | 18 | 16.1 | 18.1 | |
| DVtor (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 19 | 14.3 | 14 | 16.1 | |
| ExDet (CLIP)Backbone=RN50x16, Training Data=LVIS-base2026.06 | 17.8 | 18.8 | 19 | 18.4 | |
| F-ViT (DeCLIP)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 17.8 | 12.9 | 13.2 | 14.9 | |
| DVtor (CLIP)Backbone=RN50x16, Training Data=LVIS-base2026.06 | 17.6 | 16.9 | 15.8 | 17 | |
| F-ViT (CLIPSelf)Backbone=ViT-B/16, Training Data=LVIS-base2026.06 | 17.1 | 12 | 12.2 | 14 | |
| F-VLM (CLIP)Backbone=RN50x16, Training Data=LVIS-base2026.06 | 16.7 | 14.4 | 13.7 | 15.2 | |
| RegionCLIPBackbone=RN50*, Training Data=CC3M2026.06 | 16.6 | 13 | 9.7 | 13.9 | |
| OV-DQUOBackbone=ViT-L/14, Training Data=LVIS-base2026.06 | 16.4 | 20.6 | 21.2 | 19.1 | |
| RKDWTFBackbone=RN50* WTF8x, Training Data=LVIS-base + IN-L2026.06 | 15.8 | 14.3 | 11.9 | 14.5 | |
| RKDWTFBackbone=RN50* Base, Training Data=LVIS-base + IN-L2026.06 | 14.6 | 12.4 | 8.7 | 12.6 | |
| RKDWTFBackbone=RN50* WTF, Training Data=LVIS-base + IN-L2026.06 | 14 | 12.5 | 11.3 | 12.9 | |
| YOLOEBackbone=YOLOv11-L*, Training Data=O365 + GoldG2026.06 | 13.7 | 8.6 | 6.8 | 10.3 | |
| RKDWTFBackbone=RN50* RKDPIS, Training Data=LVIS-base + IN-L2026.06 | 13.4 | 12.1 | 10.3 | 12.3 | |
| OWL-ViTBackbone=ViT-B/16, Training Data=O365 + VG2026.06 | 13.1 | 13.9 | 13.2 | 13.5 | |
| OV-DQUOBackbone=ViT-B/16, Training Data=LVIS-base2026.06 | 12.8 | 14.8 | 14.8 | 14 |