Object Detection on LVIS (val)
67.9mAPCo-DETR
Evaluation Results
| Method | Links | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Co-DETRBackbone=ViT-L [7], enc. #params=304M2022.11 | 67.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVA-02Backbone=ViT-L [7], enc. #params=304M2022.11 | 65.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=fine-tuned2024.05 | 63.5 | 64 | 63.8 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOBackbone=InternImage-G [34], enc. #params=3.0B2022.11 | 63.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-LBackbone=Swin-L, Zero-shot=true2024.12 | 60.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APE(D)Backbone=ViT-L, Zero-shot=false2024.12 | 59.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Co-DETRBackbone=Swin-L [25], enc. #params=218M2022.11 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-ProBackbone=ViT-L, Zero-shot=false2024.12 | 55.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-X Pro + OVOD-AgentAgent=OVOD-Agent2025.11 | 54.5 | 49.2 | 53.5 | 56.9 | — | — | — | — | — | — | — | 1.2 | 0.9 | 155 | — | — | — | — | — | |
| DetCLIPv3 +Backbone=Swin-L2024.05 | 54.1 | 45.8 | 55.4 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3 + SAM3Backbone=PE-L+2026.05 | 54.1 | 55.8 | 51.7 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-X ProAgent=None2025.11 | 53.6 | 48 | 52.9 | 56.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAM3Backbone=PE-L+2026.05 | 53.6 | 54.9 | 51.1 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-H [7], enc. #params=632M2022.11 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-LDetector (Backbone)=ATSS [58] (Swin-L), Protocol=fine-tune2023.04 | 53.1 | 49 | 53.2 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L2024.05 | 53.1 | 49 | 53.2 | 54.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-ProSource type=Closed-source, Data scale=1.1M, Zero-shot=true2024.12 | 51.6 | 51.3 | 51.6 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTDetBackbone=ViT-L [7], enc. #params=307M2022.11 | 51.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOv1.6 ProSource type=Closed-source, Data scale=30M, Zero-shot=true2024.12 | 51.1 | 51.5 | 52 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroundingDINO1.5 + OVOD-AgentAgent=OVOD-Agent2025.11 | 50.8 | 44.1 | 49.5 | 53.4 | — | — | — | — | — | — | — | 1.4 | 1.2 | 145 | — | — | — | — | — | |
| ScaleDet-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 50.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScaleDet-B*Backbone=Swin-Base, Fine-tuned=true, Multi-dataset training=true2023.06 | 50.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroundingDINO1.5Agent=None2025.11 | 49.6 | 42.7 | 48.6 | 52.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 49.4 | 43.3 | 48.2 | 53.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-ST+FTBackbone=CLIP L/14, Evaluation Protocol=fine-tuning with LVIS base categories only2024.05 | 49.4 | 44.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| H-DETRBackbone=Swin-L [25], enc. #params=218M2022.11 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOv1.5 ProSource type=Closed-source, Data scale=20M, Zero-shot=true2024.12 | 47.6 | 44.6 | 47.9 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=zero-shot2024.05 | 47.6 | 44.6 | 47.9 | 48.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2-LBackbone=Swin-L, Zero-shot=true2024.12 | 45.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Trex-2-LSource type=Closed-source, Data scale=6.5M, Zero-shot=true2024.12 | 45.8 | 42.7 | 43.2 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 45.8 | 42.7 | 43.2 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroundingDINO + OVOD-AgentAgent=OVOD-Agent2025.11 | 44.4 | 32.9 | 48.5 | 53.6 | — | — | — | — | — | — | — | 2.7 | 0.7 | 120 | — | — | — | — | — | |
| Detic-BBackbone=Swin-Base, Fine-tuned=false, Multi-dataset training=true2023.06 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-TDetector (Backbone)=ATSS [58] (Swin-T), Protocol=fine-tune2023.04 | 43.7 | 40.2 | 42.7 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroundingDINOAgent=None2025.11 | 43.7 | 30.2 | 47.8 | 53.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Backbone=Swin-L2026.05 | 43.5 | 39.7 | 38.3 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eff-B7 NAS-FPN (1280) with Copy-Paste and frozen backboneBackbone=EfficientNet-B7, Resolution=1280, Architecture=NAS-FPN, Data Augmentation=Copy-Paste, Backbone freezing=true, Test-time augmentation=false2022.04 | 43.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v2Backbone=Swin-L2026.05 | 42.5 | 33.2 | 39.7 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 42 | 31.6 | 38.8 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 42 | 31.6 | 38.8 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L2026.05 | 42 | 31.6 | 38.8 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eff-B7 NAS-FPN (1280) with Copy-PasteBackbone=EfficientNet-B7, Resolution=1280, Architecture=NAS-FPN, Data Augmentation=Copy-Paste, Test-time augmentation=false2022.04 | 41.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M2024.04 | 41.4 | 41.4 | 40.5 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-LBackbone=Swin-L, Zero-shot=true2024.12 | 41.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-LSource type=Closed-source, Data scale=50M, Zero-shot=true2024.12 | 41.4 | 41.4 | 40.5 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Zero-shot=true2025.01 | 41.4 | 41.4 | 40.5 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 41.4 | 35.2 | 39.5 | 46.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 41.4 | 41.4 | 40.5 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L2026.05 | 41.4 | 41.4 | 40.5 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LVIS Challenge 2020 WinnerTest-time augmentation=false2022.04 | 41.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Frozen-DETR#epochs=24, backbone=R502024.10 | 40 | 24 | 41.8 | 44.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CP-DETR-TBackbone=Swin-T, Zero-shot=true2024.12 | 39.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eff-B7 NAS-FPN (1280) with frozen backboneBackbone=EfficientNet-B7, Resolution=1280, Architecture=NAS-FPN, Backbone freezing=true, Test-time augmentation=false2022.04 | 39.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M2024.04 | 38.9 | 37.2 | 37.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3-TBackbone=Swin-T, Zero-shot=true2024.12 | 38.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Zero-shot=true2025.01 | 38.9 | 37.2 | 37.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 38.9 | 37.2 | 37.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-B, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 38.5 | 28.2 | 34.3 | 47.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-X EdgeBackbone=EfficientViT-L2, Resolution=640*640, FPS=19.8, Zero-shot=true2025.12 | 38.4 | 38.9 | 38.3 | 38.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SupervisedDetector (Backbone)=ATSS [58] (Swin-L), Protocol=fine-tune2023.04 | 38.3 | 28.5 | 38.1 | 42.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v3Backbone=Swin-T2026.05 | 38.1 | 35.2 | 33.7 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eff-B7 NAS-FPN (1280)Backbone=EfficientNet-B7, Resolution=1280, Architecture=NAS-FPN, Test-time augmentation=false2022.04 | 37.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-LDetector (Backbone)=ATSS [58] (Swin-L), Protocol=zero-shot2023.04 | 36.6 | 33.3 | 36.2 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG,CC15M2024.04 | 36.6 | 33.3 | 36.2 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-LBackbone=Swin-L, Zero-shot=true2024.12 | 36.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG, CC15M, Zero-shot=true2025.01 | 36.6 | 33.3 | 36.2 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 36.6 | 33.3 | 36.2 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L2026.05 | 36.6 | 33.3 | 36.2 | 38.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Detic2023.04 | 36.3 | 26.7 | 36.4 | 40.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| POMP2023.04 | 36.2 | 26.8 | 36.4 | 40.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-SAM-v2Backbone=Swin-T2026.05 | 35.5 | 29.3 | 31.8 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Pre-training data=WebLI2B2024.04 | 35.2 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Zero-shot=true2024.12 | 35.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14, Pre-training data=WebLI2B, Zero-shot=true2025.01 | 35.2 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/142026.05 | 35.2 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T, Pre-training data=GroundingCap-1M, Zero-shot=true2025.01 | 34.9 | 26 | 30.1 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-B, Pre-training data=O365, GoldG, V3Det, Zero-shot=true2025.01 | 34.9 | 26.7 | 30.4 | 43.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 34.9 | 26 | 30.1 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T2026.05 | 34.9 | 26 | 30.1 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2-TBackbone=Swin-T, Zero-shot=true2024.12 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-T, Pre-training data=10M data from various resources, Zero-shot=true2025.01 | 34.8 | 29 | 31.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 34.8 | 29 | 31.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-T2026.05 | 34.8 | 29 | 31.5 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Current SOTA in each itemSource type=Open-source, Data scale=N/A, Zero-shot=true2024.12 | 34.7 | 26.9 | 32 | 41.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World + OVOD-AgentAgent=OVOD-Agent2025.11 | 33.8 | 25.2 | 33 | 36.5 | — | — | — | — | — | — | — | 2.4 | 0.5 | 90 | — | — | — | — | — | |
| DK-DETR#epochs=70, backbone=R502024.10 | 33.5 | 22.2 | 32 | 40.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLDet#epochs=96, backbone=R502024.10 | 33.4 | 22.9 | 32.8 | 38.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-WorldAgent=None2025.11 | 33.3 | 22.8 | 32.3 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OV-DINOBackbone=Swin-T, Pre-training data=O365, GoldG, CC1M, Zero-shot=true2025.01 | 32.9 | 29.1 | 30.4 | 37.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OV-DINOBackbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 32.9 | 29.1 | 30.4 | 37.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OV-DINOBackbone=Swin-T2026.05 | 32.9 | 29.1 | 30.4 | 37.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2-TDetector (Backbone)=ATSS [58] (Swin-T), Protocol=zero-shot2023.04 | 32.8 | 31 | 31.7 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Pre-training data=O365, GoldG,CC15M2024.04 | 32.8 | 31 | 31.7 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Pre-training data=O365, GoldG, CC15M, Zero-shot=true2025.01 | 32.8 | 31 | 31.7 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 32.8 | 31 | 31.7 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T2026.05 | 32.8 | 31 | 31.7 | 34.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-det-4scale#epochs=24, backbone=R502024.10 | 32.5 | 15.2 | 32.8 | 39.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RegionCLIPPretraining Dataset=CC3M, Pretraining Backbone=RN50x4, Detector Backbone=RN50x4-C4, Training Strategy=1x+Standard, Supervision=Base2021.12 | 32.3 | 22 | 32.1 | 36.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Pre-training data=O365, GoldG, GRIT, V3Det, Zero-shot=true2025.01 | 31.9 | 23.6 | 27.6 | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 31.9 | 23.6 | 27.6 | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |