Open-Vocabulary Object Detection on LVIS
42.1APrLLMDet + FG-CLIP 2
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| LLMDet + FG-CLIP 2Backbone=Swin-T + ViT-So/162025.10 | 42.1 | 45.9 | — | — | — | 44.6 | 49 | |
| LLMDet + Meta CLIP 2Backbone=Swin-T + ViT-H/142025.10 | 41.7 | 44.5 | — | — | — | 42.9 | 47.6 | |
| LLMDet + SigLIP 2Backbone=Swin-T + ViT-So/162025.10 | 41.1 | 44.3 | — | — | — | 42.7 | 46.4 | |
| LLMDet + FG-CLIP 2Backbone=Swin-T + ViT-L/162025.10 | 41 | 45.5 | — | — | — | 44.2 | 49 | |
| LLMDet + SigLIP 2Backbone=Swin-T + ViT-L/162025.10 | 40.4 | 43.6 | — | — | — | 42 | 45.9 | |
| LLMDet + FG-CLIP 2Backbone=Swin-T + ViT-B/162025.10 | 37.4 | 44 | — | — | — | 42.8 | 48.2 | |
| DetCLIP v3Backbone=Swin-T2025.10 | 37.2 | 38.9 | — | — | — | 37.5 | 41.2 | |
| LLMDet + FG-CLIPBackbone=Swin-T + ViT-L/142025.10 | 37 | 43.1 | — | — | — | 41.3 | 47.7 | |
| OWL-STBackbone=ViT-L/142025.10 | 36.2 | 35.2 | — | — | — | — | — | |
| LLMDet + SigLIP 2Backbone=Swin-T + ViT-B/162025.10 | 36.1 | 41.8 | — | — | — | 39.9 | 45.2 | |
| LLMDet + FG-CLIPBackbone=Swin-T + ViT-B/162025.10 | 35.1 | 41 | — | — | — | 38.9 | 45.8 | |
| LLMDetBackbone=Swin-L2025.10 | 31.6 | 42 | — | — | — | 38.8 | 50.2 | |
| OWL-STBackbone=ViT-B/162025.10 | 30.3 | 28.6 | — | — | — | — | — | |
| OV-DINOBackbone=Swin-T2025.10 | 29.1 | 32.9 | — | — | — | 30.4 | 37.4 | |
| T-Rex2Backbone=Swin-T2025.10 | 29 | 34.8 | — | — | — | 31.5 | 41.2 | |
| CORA+Extra Dataset=IN-21k, Pre-train Model=CLIP (text encoder)2023.03 | 28.1 | — | — | — | — | — | — | |
| DeticExtra Dataset=IN-21k, Pre-train Model=CLIP (text encoder)2023.03 | 26.2 | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T2025.10 | 26 | 34.9 | — | — | — | 30.1 | 44.3 | |
| YOLO-World-LBackbone=YOLOv8-L2025.10 | 22.9 | 28.7 | — | — | — | 24.9 | 35.4 | |
| MEDetExtra Dataset=CC3M, Pre-train Model=CLIP (ViT-B/32)2023.03 | 22.4 | — | — | — | — | — | — | |
| CORAPre-train Model=CLIP (RN50x4)2023.03 | 22.2 | — | — | — | — | — | — | |
| RegionCLIPExtra Dataset=CC3M, Pre-train Model=CLIP (RN50x4)2023.03 | 22 | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-L2025.10 | 19.7 | 29.1 | — | — | — | 25.6 | 37.2 | |
| OV-DETRPre-train Model=CLIP (ViT-B/32)2023.03 | 17.4 | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L2025.10 | 17.1 | 26.9 | — | — | — | 23.3 | 36.4 | |
| ViLDPre-train Model=CLIP (ViT-B/32)2023.03 | 16.3 | — | — | — | — | — | — | |
| BOUNDdepth=32025.10 | — | 12 | 38.8 | 26.8 | 79.5 | — | — | |
| BOUNDdepth=52025.10 | — | 12 | 38.7 | 26.3 | 38.1 | — | — | |
| PROB2025.10 | — | 2.9 | 11.5 | 30.1 | — | — | — |