Object Detection on LVIS mini (val)
68.1mAPGrounding DINO 1.5 Pro
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=fine-tuned2024.05 | 68.1 | 68.7 | 69.5 | 66.6 | — | — | — | — | |
| DetCLIPv3 +Backbone=Swin-L2024.05 | 60.8 | 56.7 | 63.2 | 59.4 | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L2024.05 | 60.5 | 60.7 | — | — | — | — | — | — | |
| VL-SAM-v3 + SAM3Backbone=PE-L+2026.05 | 60.2 | 63.4 | 59.9 | 58.8 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L2024.05 | 60.1 | 58.3 | 61.7 | 59.1 | — | — | — | — | |
| GLIPv2Backbone=Swin-H2024.05 | 59.8 | — | — | — | — | — | — | — | |
| SAM3Backbone=PE-L+2026.05 | 59.1 | 61.9 | 59 | 58.8 | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Vocabulary Type=Human-curated vocabulary2023.06 | 55.8 | 50 | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=zero-shot2024.05 | 55.7 | 56.1 | 57.5 | 54.1 | — | — | — | — | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 55 | 51.1 | 54.5 | 56.1 | — | — | — | — | |
| T-Rex2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 54.9 | 49.2 | 54.8 | 56.1 | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Evaluation Protocol=fine-tuning with LVIS base categories only2024.05 | 54.4 | 46.1 | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Vocabulary Type=Open vocabulary2023.06 | 54.1 | 46.1 | — | — | — | — | — | — | |
| VL-SAM-v3Backbone=Swin-L2026.05 | 53.4 | 50.9 | 50.8 | 56.6 | — | — | — | — | |
| Grounding DINO TBackbone=Swin-T, Pre-Training Data=O365, GoldG, Evaluation Protocol=Fine-Tune Setting2023.03 | 52.1 | 35.4 | 51.3 | 55.7 | — | — | — | — | |
| VL-SAM-v2Backbone=Swin-L2026.05 | 51.7 | 47.2 | 46.7 | 56.6 | — | — | — | — | |
| OWL-ST+FTBackbone=SigLIP G/14, Vocabulary Type=Open vocabulary2023.06 | 51.3 | 50.9 | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP B/16, Vocabulary Type=Human-curated vocabulary2023.06 | 51.1 | 41.9 | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L2026.05 | 51.1 | 45.1 | 46.1 | 56.6 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Pre-Training Data=0365, GoldG, CC15M, Evaluation Protocol=Fine-Tune Setting2023.03 | 50.7 | 44.3 | 52.4 | 50.3 | — | — | — | — | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 50.6 | 41.7 | 46.2 | 56.1 | — | — | — | — | |
| GLIPv2Backbone=Swin-H, Pre-training data=FiveODs, GoldG, CC15M,SBU2024.04 | 50.1 | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H, Vocabulary Type=Open vocabulary2023.06 | 50.1 | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H2026.05 | 50.1 | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M2024.04 | 48.8 | 49.9 | 49.7 | 47.8 | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 48.8 | 49.9 | 49.7 | 47.8 | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L2026.05 | 48.8 | 49.9 | 49.7 | 47.8 | — | — | — | — | |
| GLIPv2Backbone=Swin-B, Vocabulary Type=Open vocabulary2023.06 | 48.5 | — | — | — | — | — | — | — | |
| VL-SAM-v3Backbone=Swin-T2026.05 | 47.7 | 44.9 | 44.9 | 50.7 | — | — | — | — | |
| T-Rex2Type=Open-set Detection Model2025.12 | 47.6 | 45.4 | 46 | 49.5 | — | — | — | — | |
| T-Rex2Open Source=N, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 47.6 | — | — | — | — | — | — | — | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 47.3 | 43.5 | 45.9 | 49.3 | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP B/16, Vocabulary Type=Open vocabulary2023.06 | 47.2 | 37.8 | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M2024.04 | 47 | 45.1 | 47.7 | 46.7 | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 47 | 45.1 | 47.7 | 46.7 | — | — | — | — | |
| VL-SAM-v2Backbone=Swin-T2026.05 | 45.7 | 41.2 | 41.1 | 50.7 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG,CC15M2024.04 | 44.7 | 43.1 | 46.3 | 43.7 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Vocabulary Type=Human-curated vocabulary2023.06 | 44.7 | 43.1 | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 44.7 | 37.3 | 39.5 | 50.7 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 44.7 | 43.1 | 46.3 | 43.7 | — | — | — | — | |
| LLMDetBackbone=Swin-T2026.05 | 44.7 | 37.3 | 39.5 | 50.7 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L2026.05 | 44.7 | 43.1 | 46.3 | 43.7 | — | — | — | — | |
| DINO-X EdgeBackbone=EfficientViT-L2, Resolution=640*640, FPS=19.8, Zero-shot=true2025.12 | 44.5 | 41.4 | 47.3 | 42.6 | — | — | — | — | |
| MQ-GLIPBackbone=Swin-L, Data=FourODs, GoldG, Cap24M, LVIS-5VQ, LVIS-5VQ=true, Evaluation Protocol=Zero-shot transfer2023.11 | 43.4 | 34.5 | 41.2 | 46.9 | — | — | — | — | |
| T-Rex2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 42.8 | 37.4 | 39.7 | 46.5 | — | — | — | — | |
| T-Rex2Backbone=Swin-T2026.05 | 42.8 | 37.4 | 39.7 | 46.5 | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 41.4 | 34.2 | 37.4 | 46.2 | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Pre-training data=WebLI2B2024.04 | 40.9 | 41.5 | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/142026.05 | 40.9 | 41.5 | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Pre-training data=O365, GoldG,CC15M2024.04 | 40.4 | 36 | 41.7 | 40.4 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Vocabulary Type=Human-curated vocabulary2023.06 | 40.4 | 36 | — | — | — | — | — | — | |
| Det CLIPv2Backbone=Swin-T, Pre-Training Data=0365, GoldG, CC15M, Evaluation Protocol=Zero-Shot Setting2023.03 | 40.4 | 36 | 41.7 | 40 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 40.4 | 36 | 41.7 | 40.4 | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T2026.05 | 40.4 | 36 | 41.7 | 40.4 | — | — | — | — | |
| OV-DINOBackbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 40.1 | 34.5 | 39.5 | 41.5 | — | — | — | — | |
| OV-DINOBackbone=Swin-T2026.05 | 40.1 | 34.5 | 39.5 | 41.5 | — | — | — | — | |
| DetCLIPBackbone=Swin-L, Pre-training data=O365, GoldG, YFCC1M2024.04 | 38.6 | 36 | 38.3 | 39.3 | — | — | — | — | |
| DetCLIPBackbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 38.6 | 36 | 38.3 | 39.3 | — | — | — | — | |
| DetCLIPBackbone=Swin-L2026.05 | 38.6 | 36 | 38.3 | 39.3 | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Vocabulary Type=Open vocabulary2023.06 | 38.1 | 39 | — | — | — | — | — | — | |
| OWLv2Backbone=Swin-L, Data=O365, VG, WebLI, Evaluation Protocol=Zero-shot transfer2023.11 | 38.1 | 39 | — | — | — | — | — | — | |
| OWL-STBackbone=SigLIP G/14, Vocabulary Type=Open vocabulary2023.06 | 37.8 | 40.9 | — | — | — | — | — | — | |
| WeDetect-TinyBackbone=ConvNext-T, Resolution=640*640, #Params=33M, FPS=62.5, Zero-shot=true2025.12 | 37.4 | 33.3 | 36.8 | 38.8 | — | — | — | — | |
| T-Rex2Open Source=N, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 37.4 | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L, Data=FourODs, GoldG, Cap24M, Evaluation Protocol=Zero-shot transfer2023.11 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| GLIPBackbone=Swin-L, Pre-training data=FourODs, GoldG, Cap24M2024.04 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| GLIPBackbone=Swin-L, Resolution=800*1333, #Params=430M, FPS=3.1, Zero-shot=true2025.12 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| GLIPType=Open-set Detection Model2025.12 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| GLIPBackbone=Swin-L2026.05 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| DECOLA Phase 2Backbone=Swin-L, Data=O365, OI, IN-21K‡, Evaluation Protocol=Zero-shot transfer2023.11 | 36.8 | 41.5 | 38 | 34.9 | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Pre-training data=O365, GoldG, YFCC1M2024.04 | 35.9 | 33.2 | 35.7 | 36.4 | — | — | — | — | |
| YOLOE-8-LBackbone=YOLOv8-L, Resolution=640*640, #Params=45M, Zero-shot=true2025.12 | 35.9 | 33.2 | 34.8 | 37.3 | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 35.9 | 33.2 | 35.7 | 36.4 | — | — | — | — | |
| DetCLIPBackbone=Swin-T2026.05 | 35.9 | 33.2 | 35.7 | 36.4 | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 35.7 | — | — | — | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Resolution=640*640, #Params=48M, FPS=54.6, Zero-shot=true2025.12 | 35.4 | 27.6 | 34.1 | 38 | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L2026.05 | 35.4 | 27.6 | 34.1 | 38 | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 34.9 | — | — | — | — | — | — | — | |
| Desco-GLIPBackbone=Swin-T2026.05 | 34.6 | 30.8 | 30.5 | 39 | — | — | — | — | |
| OWL-STBackbone=CLIP B/16, Pre-training data=WebLI2B2024.04 | 34.4 | 38.3 | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP B/162026.05 | 34.4 | 38.3 | — | — | — | — | — | — | |
| GroundingDINOBackbone=Swin-L, Data=O365, OI, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Zero-shot transfer2023.11 | 33.9 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| GroundingDINOBackbone=Swin-L, Pre-training data=O365,OI, GoldG, Cap4M, COCO, RefC2024.04 | 33.9 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| Grounding DINO LBackbone=Swin-L, Pre-Training Data=0365, OI, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Zero-Shot Setting2023.03 | 33.9 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| Grounding-DINOBackbone=Swin-L, Resolution=800*1333, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 33.9 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| Grounding-DINOBackbone=Swin-L2026.05 | 33.9 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| CapDetBackbone=Swin-T, Pre-training data=O365,VG2024.04 | 33.8 | 29.6 | 32.8 | 35.5 | — | — | — | — | |
| CapDetBackbone=Swin-T2026.05 | 33.8 | 29.6 | 32.8 | 35.5 | — | — | — | — | |
| CoT4DET-7BType=MLLM, Category setting=Ground-truth category setting2025.12 | 33.7 | 40.3 | 38.3 | 28.4 | 75.3 | 53.9 | — | — | |
| YOLOE-v11-LOpen Source=Y, Prompt Type=Visual-G, Backbone=YOLOv11-L, VLM sup.=MobileCLIP, Data Size=1.4M, Training Data=O365, GoldG2026.04 | 33.7 | — | — | — | — | — | — | — | |
| Mask R-CNNBackbone=RN101, Evaluation Protocol=Fine-Tune Setting2023.03 | 33.3 | 26.3 | 34 | 33.9 | — | — | — | — | |
| Grounding DINOType=Open-set Detection Model2025.12 | 33 | 22.2 | 30.7 | 38.8 | — | — | — | — | |
| CoT4DET-7BType=MLLM, Category setting=Full-category setting2025.12 | 32.9 | 33 | 38.8 | 27.7 | 72.2 | 54.6 | — | — | |
| DECOLA Phase 2Backbone=Swin-T, Data=O365, IN-21K‡, Evaluation Protocol=Zero-shot transfer2023.11 | 32 | 32.8 | 32 | 31.8 | — | — | — | — | |
| OWL-STBackbone=CLIP B/16, Vocabulary Type=Open vocabulary2023.06 | 31.8 | 35.4 | — | — | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 31.5 | — | — | — | — | — | — | — | |
| MQ-GLIPBackbone=Swin-T, Data=O365, GoldG, Cap4M, LVIS-5VQ, LVIS-5VQ=true, Evaluation Protocol=Zero-shot transfer2023.11 | 30.4 | 21 | 27.5 | 34.6 | — | — | — | — | |
| MQ-GroundingDINOBackbone=Swin-T, Data=O365, GoldG, Cap4M, LVIS-5VQ, LVIS-5VQ=true, Evaluation Protocol=Zero-shot transfer2023.11 | 30.2 | 21.7 | 26.2 | 35.2 | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 29.6 | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-T, Data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-shot transfer2023.11 | 29 | — | — | — | — | — | — | — |