Object Detection on LVIS (minival)
71.9APCo-DETR
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Co-DETRBackbone=ViT-L [7], enc. #params=304M2022.11 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-L*Open Source=N, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.3M, Training Data=O365, OpenImages, GoldG, V3Det2026.04 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-LBackbone=Swin-L, Zero-shot=true2024.12 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOBackbone=InternImage-G [34], enc. #params=3.0B2022.11 | 65.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 65.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APE(D)Backbone=ViT-L, Zero-shot=false2024.12 | 64.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APE (D)Backbone=ViT-L [6], Pre-training data=COCO, LVIS, O365, OID, VG, RefC, SA-1B, GoldG, PhraseCut, Evaluation Protocol=Supervised2024.05 | 64.7 | — | 62.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 64.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 64.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-TOpen Source=N, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.3M, Training Data=O365, OpenImages, GoldG, V3Det2026.04 | 64.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Open Source=N, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 62.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DETRBackbone=Swin-L [25], enc. #params=218M2022.11 | 62.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 61.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3+FTBackbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=LVISbase2024.04 | 60.8 | — | 56.7 | 63.2 | 59.4 | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H [25], enc. #params=637M2022.11 | 59.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2-HBackbone=Swin-H, Zero-shot=false2024.12 | 59.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Open Source=N, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 59.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-ProSource type=Closed-source, Data scale=1.1M, Zero-shot=true2024.12 | 58.2 | — | 60.6 | 59.2 | 56.8 | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOv1.6 ProSource type=Closed-source, Data scale=30M, Zero-shot=true2024.12 | 57.7 | — | 57.5 | 60.5 | 55.3 | — | — | — | — | — | — | — | — | — | — | |
| APE (B)Backbone=ViT-L, Pre-training data=COCO, LVIS, O365, OID, VG, Evaluation Protocol=Supervised2024.05 | 57.7 | — | 57 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOv1.5 ProSource type=Closed-source, Data scale=20M, Zero-shot=true2024.12 | 55.7 | — | 56.1 | 57.5 | 54.1 | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L [6], Pre-training data=Grounding-20M, Evaluation Protocol=Zero-shot2024.05 | 55.7 | — | 56.1 | 57.5 | 54.1 | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2-LBackbone=Swin-L, Zero-shot=true2024.12 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Trex-2-LSource type=Closed-source, Data scale=6.5M, Zero-shot=true2024.12 | 54.9 | — | 49.2 | 54.8 | 56.1 | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2 (text)Backbone=Swin-L, Pre-training data=O365, OID, GoldG, CC3M, SBU, LAION, Evaluation Protocol=Zero-shot2024.05 | 54.9 | — | 49.2 | 54.8 | 56.1 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3+FTBackbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=LVISbase2024.04 | 54.4 | — | 46.7 | 56.1 | 54.3 | — | — | — | — | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Pre-training data=WebLI2B, Fine-tuning data=LVISbase2024.04 | 54.1 | — | 46.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3 + SAM3Base detector / backbone=SAM3 / PE-L+, Candidate generator=Qwen3-VL (8B), Evaluation Protocol=Zero-shot2026.05 | 51.7 | — | 54 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 51.1 | — | 45.1 | 46.1 | 56.6 | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H, Pre-training data=FiveODs, GoldG, CC15M, SBU, Zero-shot=true2025.01 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H [32], Pre-training data=FourODS, COCO, GoldG, CC15M, SBU, Evaluation Protocol=Supervised2024.05 | 50.1 | — | 33.9 | 22.2 | 30.7 | — | — | — | — | — | — | — | — | — | — | |
| SAM3Base detector / backbone=SAM3 / PE-L+, Candidate generator=Qwen3-VL (8B), Evaluation Protocol=Zero-shot2026.05 | 49.9 | — | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-LBackbone=Swin-L, Zero-shot=true2024.12 | 48.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-LSource type=Closed-source, Data scale=50M, Zero-shot=true2024.12 | 48.8 | — | 49.9 | 49.7 | 47.8 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Zero-shot=true2025.01 | 48.8 | — | 49.9 | 49.7 | 47.8 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Evaluation Protocol=Zero-shot2024.05 | 48.8 | — | 49.9 | 49.7 | 47.8 | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-B, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 48.3 | — | 40.8 | 43.1 | 54.3 | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-TBackbone=Swin-T, Zero-shot=true2024.12 | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2 (visual)Backbone=Swin-L, Pre-training data=O365, OID, HierText, CrowdHuman, SA-1B, Evaluation Protocol=Zero-shot2024.05 | 47.6 | — | 45.4 | 46 | 49.5 | — | — | — | — | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP B/16, Pre-training data=WebLI2B, Fine-tuning data=LVISbase2024.04 | 47.2 | — | 37.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-TBackbone=Swin-T, Zero-shot=true2024.12 | 47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Zero-shot=true2025.01 | 47 | — | 45.1 | 47.7 | 46.7 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=None (Zero-shot)2024.04 | 45.8 | — | 46.9 | 45.9 | 45.5 | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Base detector / backbone=LLMDet / Swin-L, Candidate generator=Qwen3-VL (8B), Evaluation Protocol=Zero-shot2026.05 | 44.8 | — | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-LBackbone=Swin-L, Zero-shot=true2024.12 | 44.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 44.7 | — | 37.3 | 39.5 | 50.7 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG, CC15M, Zero-shot=true2025.01 | 44.7 | — | 43.1 | 46.3 | 43.7 | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-B, Pre-training data=O365, GoldG, V3Det, Zero-shot=true2025.01 | 44.5 | — | 37.5 | 39.9 | 49.9 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Fine-tuning data=None (Zero-shot)2024.04 | 43.7 | — | 39.3 | 44.5 | 43.7 | — | — | — | — | — | — | — | — | — | — | |
| Current SOTA in each itemSource type=Open-source, Data scale=N/A, Zero-shot=true2024.12 | 43.4 | — | 34.5 | 41.2 | 46.9 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG, CC15M, Evaluation Protocol=Zero-shot2024.05 | 43.1 | — | 46.3 | 43.7 | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2-TBackbone=Swin-T, Zero-shot=true2024.12 | 42.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-T, Pre-training data=10M data from various resources, Zero-shot=true2025.01 | 42.8 | — | 37.4 | 39.7 | 46.5 | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Base detector / backbone=LLMDet / Swin-L, Candidate generator=InternVL-2.5 (8B), Evaluation Protocol=Zero-shot2026.05 | 41.7 | — | 38.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14 [23], Pre-training data=WebLI2B, Evaluation Protocol=Zero-shot2024.05 | 41.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Lr schd=zero-shot2024.01 | 41.4 | — | 34.2 | 37.4 | 46.2 | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Pre-training data=O365, GoldG, GRIT, V3Det, Zero-shot=true2025.01 | 41.4 | — | 34.2 | 37.4 | 46.2 | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Base detector / backbone=LLMDet / Swin-T, Candidate generator=Qwen3-VL (8B), Evaluation Protocol=Zero-shot2026.05 | 41.4 | — | 39.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Zero-shot=true2024.12 | 40.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Pre-training data=WebLI2B, Zero-shot=true2025.01 | 40.9 | — | 41.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Base detector / backbone=LLMDet / Swin-T, Candidate generator=InternVL-2.5 (8B), Evaluation Protocol=Zero-shot2026.05 | 40.6 | — | 37.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c2)Backbone=Swin-T, Lr schd=zero-shot2024.01 | 40.5 | — | 33 | 35.6 | 45.9 | — | — | — | — | — | — | — | — | — | — | |
| MM-Grounding-DINOPrompt Type=Text, Backbone=Swin-T, Training Data=O365, GoldG, V3Det, Zero-shot=true2026.04 | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Pre-training data=O365, GoldG, CC15M, Zero-shot=true2025.01 | 40.4 | — | 36 | 41.7 | 40.4 | — | — | — | — | — | — | — | — | — | — | |
| OV-DINOBackbone=Swin-T, Pre-training data=O365, GoldG, CC1M, Zero-shot=true2025.01 | 40.1 | — | 34.5 | 39.5 | 41.5 | — | — | — | — | — | — | — | — | — | — | |
| PET-DINOPrompt Type=Text, Backbone=Swin-L, Training Data=O365†, Zero-shot=true2026.04 | 39.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-L, Pre-training data=O365, GoldG, YFCC1M, Zero-shot=true2025.01 | 38.6 | — | 36 | 38.3 | 39.3 | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Pre-training data=WebLI2B, Fine-tuning data=None (Zero-shot)2024.04 | 38.1 | — | 39 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-DINO-LBackbone=Swin-L, Training Data=OG, Zero-shot=true2026.06 | 38.1 | — | 39.2 | 38.1 | 37.7 | — | — | — | — | — | — | 40.2 | 41.8 | 40.9 | 40.1 | |
| PET-DINOPrompt Type=Text, Backbone=Swin-T, Training Data=O365†, Zero-shot=true2026.04 | 37.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L, Pre-training data=FourODs, GoldG, Cap24M, Zero-shot=true2025.01 | 37.3 | — | 28.2 | 34.3 | 41.5 | — | — | — | — | — | — | — | — | — | — | |
| GLIP-LTraining Data=FourODs, GoldG, Cap24M2023.11 | 37.3 | — | 28.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L, Pre-training data=FourODs, GoldG, Cap24M, Evaluation Protocol=Zero-shot2024.05 | 37.3 | — | 28.2 | 34.3 | 41.5 | — | — | — | — | — | — | — | — | — | — | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 37.2 | — | 35.8 | 37.2 | 37.6 | — | — | — | — | — | — | — | — | — | — | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, RefC, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 37.1 | — | 36.2 | 37.1 | 37.4 | — | — | — | — | — | — | — | — | — | — | |
| RegionSpot-Pro↑336Training Data=O365, OI, V3DET, Input Resolution=3362023.11 | 36.9 | — | 33.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-L, Pre-training data=O365V2, OpenImageV6, GoldG, Zero-shot=true2025.01 | 36.8 | — | 28.1 | 31.8 | 42.8 | — | — | — | — | — | — | — | — | — | — | |
| MM-Grounding-DINOPrompt Type=Text, Backbone=Swin-L, Training Data=O365V2, OpenImage, GoldG, Zero-shot=true2026.04 | 36.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c1)Backbone=Swin-T, Lr schd=zero-shot2024.01 | 36.5 | — | 26.6 | 32.4 | 41.8 | — | — | — | — | — | — | — | — | — | — | |
| VL-DINO-TBackbone=Swin-T, Training Data=OG, Zero-shot=true2026.06 | 36.3 | — | 37.8 | 35.6 | 36.7 | — | — | — | — | — | — | 38.7 | 40.6 | 37.9 | 39 | |
| Grounding DINO 1.5 EdgeBackbone=Efficient ViT-L1, Pre-training data=Grounding-20M, test size=800x1333, Zero-shot=true, Language Cache=false2024.05 | 36.2 | — | 33.2 | 36.6 | — | 36.3 | 18.5 | 75.2 | 5.5 | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-L, Pre-training data=O365, GoldG, YFCC1M, Evaluation Protocol=Zero-shot2024.05 | 36 | — | 38.3 | 39.3 | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Pre-training data=O365, GoldG, YFCC1M, Zero-shot=true2025.01 | 35.9 | — | 33.2 | 35.7 | 36.4 | — | — | — | — | — | — | — | — | — | — | |
| YOLOE-8-LBackbone=YOLOv8-L, Pre-train Data=OG, #Params=45M, Resolution=640x640, Zero-shot=true2026.01 | 35.9 | — | 33.2 | 34.8 | 37.3 | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(b)Backbone=Swin-T, Lr schd=zero-shot2024.01 | 35.7 | — | 28.1 | 30.2 | 42 | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Zero-shot=true2024.12 | 35.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Pre-training data=O365, GoldG, CC3M, Zero-shot=true2025.01 | 35.4 | — | 27.6 | 34.1 | 38 | — | — | — | — | — | — | — | — | — | — | |
| YOLO-Worldv2-LBackbone=YOLOv8-L, Pre-train Data=OG, #Params=48M, Resolution=640x640, Zero-shot=true2026.01 | 35.4 | — | 27.6 | 34.1 | 38 | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Params(M)=110, Evaluation Setting=Zero-shot2026.01 | 35 | — | 27.1 | 32.8 | 38.3 | — | — | — | — | — | — | — | — | — | — | |
| OmDet-Turbo-BBackbone=ConvNeXt-B, Zero-shot=true2024.12 | 34.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDet-Turbo-BBackbone=ConvNeXt-B, Pre-train Data=OG, #Params=175M, Resolution=640x640, Zero-shot=true2026.01 | 34.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDet-Turbo-BBackbone=ConvNeXt-B [20], Pre-training data=O365, GoldG, PhraseCut, Hake, HOI-A, Evaluation Protocol=Zero-shot2024.05 | 34.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Desco-GLIPBackbone=Swin-T, Pre-training data=O365, GoldG, CC3M, Zero-shot=true2025.01 | 34.6 | — | 30.8 | 30.5 | 39 | — | — | — | — | — | — | — | — | — | — | |
| OWL-ViTBackbone=ViT-L [5], Pre-training data=O365, OID, VG, LIT, Evaluation Protocol=Zero-shot2024.05 | 34.6 | — | 31.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIPBackbone=Swin-L, Pre-training data=O365, Evaluation Protocol=Zero-shot2024.05 | 34.5 | — | 41.2 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP B/16, Pre-training data=WebLI2B, Zero-shot=true2025.01 | 34.4 | — | 38.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Pre-train Data=OG, Resolution=800x1333, Zero-shot=true2026.01 | 34.4 | — | 26.9 | 33.9 | 36.3 | — | — | — | — | — | — | — | — | — | — | |
| DetCLIP-TBackbone=Swin-T, Params(M)=155, Evaluation Setting=Zero-shot2026.01 | 34.4 | — | 26.9 | 33.9 | 36.3 | — | — | — | — | — | — | — | — | — | — | |
| X-DETRTraining Data=LVIS, GoldG+, CC, LocNar, Backbone=RN101, Detector=Def.DETR [63]2023.08 | 34 | — | 24.7 | 34.6 | 35.1 | — | — | — | — | — | — | — | — | — | — | |
| Grounding-DINO-LBackbone=Swin-L, Zero-shot=true2024.12 | 33.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — |