Object Detection on LVIS v1.0 (r, c, f, Overall)
24.8AP (rare)VLDet-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VLDet-LPre-train Data=O365, Backbone=ViT-L2026.01 | 24.8 | 44.7 | 48 | 44.6 | |
| BARONPre-train Data=CLIP+COCO Cap, Backbone=RN502026.01 | 23.2 | 29.3 | 32.5 | 29.5 | |
| YOLO-World-LPre-train Data=O365+Gold+CC3M, Backbone=Y8-L2026.01 | 20.4 | 31.1 | 43.5 | 34.1 | |
| F-VLMPre-train Data=CLIP, Backbone=RN502026.01 | 18.6 | — | — | 24.2 | |
| RegionCLIPPre-train Data=CC3M, Backbone=RN502026.01 | 17.1 | 27.4 | 34 | 28.2 | |
| VLDet-BPre-train Data=O365, Backbone=ViT-B2026.01 | 16.9 | 30.1 | 43.8 | 35.6 | |
| ViLDPre-train Data=CC3M, Backbone=RN502026.01 | 16.7 | 26.5 | 34.2 | 27.8 | |
| YOLO-World-MPre-train Data=O365+Gold, Backbone=Y8-M2026.01 | 15.9 | 24.6 | 39 | 28.8 |