Object Detection on COCO (APbbox)
61.3AP (bbox)HIPIE
Evaluation Results
| Method | Links | |
|---|---|---|
| HIPIEBackbone=ViT-H2023.07 | 61.3 | |
| HIPIEBackbone=ViT-H2023.07 | 61.3 | |
| APE (B)Backbone=ViT-L, Pre-training data=COCO, LVIS, O365, OID, VG, Evaluation Protocol=Supervised2024.05 | 60.7 | |
| GLIPv2Backbone=Swin-H [32], Pre-training data=FourODS, COCO, GoldG, CC15M, SBU, Evaluation Protocol=Supervised2024.05 | 60.6 | |
| MixPLDetector=DINO, Backbone=Swin-L2023.12 | 60.2 | |
| AIMv2Evaluation protocol=Finetuning on grounding dataset mixture, Detection mode=Open-vocabulary2024.11 | 60.2 | |
| DINOv2Evaluation protocol=Finetuning on grounding dataset mixture, Detection mode=Open-vocabulary2024.11 | 60.1 | |
| Soft TeacherDetector=HTC++, Backbone=Swin-L2023.12 | 59.9 | |
| DFN-CLIPEvaluation protocol=Finetuning on grounding dataset mixture, Detection mode=Open-vocabulary2024.11 | 59.8 | |
| GLEE-ProBackbone=ViT-L [6], Pre-training data=GLEE-merged-10M (COCO, LVIS, etc.), Evaluation Protocol=Supervised2024.05 | 59.6 | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 59.2 | |
| OAI CLIPEvaluation protocol=Finetuning on grounding dataset mixture, Detection mode=Open-vocabulary2024.11 | 59.1 | |
| SigLIPEvaluation protocol=Finetuning on grounding dataset mixture, Detection mode=Open-vocabulary2024.11 | 58.8 | |
| APE (D)Backbone=ViT-L [6], Pre-training data=COCO, LVIS, O365, OID, VG, RefC, SA-1B, GoldG, PhraseCut, Evaluation Protocol=Supervised2024.05 | 58.3 | |
| APE-D*training=partially trained on LVIS2025.11 | 58.3 | |
| SAM 32025.11 | 56.4 | |
| DINO-X2025.11 | 56 | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 55.6 | |
| LLMDet-L2025.11 | 55.6 | |
| Grounding DINOBackbone=Swin-L [19], Pre-training data=O365, OID, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Supervised2024.05 | 55.5 | |
| TEC_MAEBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Li et al., 2022b2022.10 | 54.6 | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 54.5 | |
| Grounding DINO 1.5 ProBackbone=ViT-L [6], Pre-training data=Grounding-20M, Evaluation Protocol=Zero-shot2024.05 | 54.3 | |
| MAEBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Li et al., 2022b2022.10 | 54 | |
| HIPIEBackbone=RN502023.07 | 53.9 | |
| HIPIEBackbone=RN502023.07 | 53.9 | |
| OmDet-Turbo-BBackbone=ConvNeXt-B [20], Pre-training data=O365, GoldG, PhraseCut, Hake, HOI-A, Evaluation Protocol=Zero-shot2024.05 | 53.4 | |
| VIC-MAEpre-train data=IN1K+K710+MiT, Backbone=ViT-B Mask R-CNN2023.03 | 53.2 | |
| TEC_iBOTBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Zhou et al., 2022a2022.10 | 52.7 | |
| VIC-MAEpre-train data=IN1K+K400, Backbone=ViT-B Mask R-CNN2023.03 | 52.5 | |
| Grounding-DINOBackbone=Swin-L, Resolution=800*1333, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 52.5 | |
| Grounding DINOBackbone=Swin-L, Pre-training data=O365, OID, GoldG, Evaluation Protocol=Zero-shot2024.05 | 52.5 | |
| C-MAEpre-train data=IN1K, Backbone=ViT-B Mask R-CNN2023.03 | 52.4 | |
| T-Rex2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 52.2 | |
| T-Rex2 (text)Backbone=Swin-L, Pre-training data=O365, OID, GoldG, CC3M, SBU, LAION, Evaluation Protocol=Zero-shot2024.05 | 52.2 | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 52.1 | |
| iBOTBackbone=ViT-B, Framework=Cascade MaskRCNN, Source Implementation=Zhou et al., 2022a2022.10 | 51.2 | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 50.4 | |
| MAEpre-train data=IN1K, Backbone=ViT-B Mask R-CNN2023.03 | 50.3 | |
| OV-DINOBackbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 50.2 | |
| GLIPBackbone=Swin-L, Resolution=800*1333, #Params=430M, FPS=3.1, Zero-shot=true2025.12 | 49.8 | |
| GLIPBackbone=Swin-L, Pre-training data=FourODs, GoldG, Cap24M, Evaluation Protocol=Zero-shot2024.05 | 49.8 | |
| DINO-X EdgeBackbone=EfficientViT-L2, Resolution=640*640, FPS=19.8, Zero-shot=true2025.12 | 48.7 | |
| DetCLIPv3Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 48.5 | |
| Grounding-DINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 48.4 | |
| Grounding DINOBackbone=Swin-T, Pre-training data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-shot2024.05 | 48.4 | |
| DetCLIPv3Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 47.2 | |
| T-Rex2 (visual)Backbone=Swin-L, Pre-training data=O365, OID, HierText, CrowdHuman, SA-1B, Evaluation Protocol=Zero-shot2024.05 | 46.5 | |
| ODISEBackbone=ViT-H+SD2023.07 | 46.1 | |
| ODISEBackbone=ViT-H+SD2023.07 | 46.1 | |
| GLIPBackbone=Swin-T, Resolution=800*1333, #Params=232M, FPS=5.4, Zero-shot=true2025.12 | 46.1 | |
| OWLv2*training=partially trained on LVIS2025.11 | 46.1 | |
| T-Rex2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 45.8 | |
| gDino-T2025.11 | 45.7 | |
| DetCLIPv3Backbone=Swin-L, Pre-training data=O365, V3Det, GoldG, GranuCap50M, Evaluation Protocol=Zero-shot2024.05 | 45.1 | |
| YOLO-World-LBackbone=YOLOv8-L, Resolution=640*640, #Params=48M, FPS=54.6, Zero-shot=true2025.12 | 44.9 | |
| WeDetect-TinyBackbone=ConvNext-T, Resolution=640*640, #Params=33M, FPS=62.5, Zero-shot=true2025.12 | 44.9 | |
| DetCLIPv2Backbone=Swin-L, Pre-training data=O365, GoldG, CC15M, Evaluation Protocol=Zero-shot2024.05 | 44.7 | |
| MQ-GLIPBackbone=Swin-L, Pre-training data=O365, Evaluation Protocol=Zero-shot2024.05 | 43.4 | |
| OWL-ViTBackbone=ViT-L [5], Pre-training data=O365, OID, VG, LIT, Evaluation Protocol=Zero-shot2024.05 | 42.2 | |
| OWL-STBackbone=CLIP L/14 [23], Pre-training data=WebLI2B, Evaluation Protocol=Zero-shot2024.05 | 40.9 | |
| DetCLIPBackbone=Swin-L, Pre-training data=O365, GoldG, YFCC1M, Evaluation Protocol=Zero-shot2024.05 | 38.6 | |
| OWLv22025.11 | 38.2 | |
| YOLO-WorldBackbone=YOLOv8-L [10], Pre-training data=O365, GoldG, CC3M, Evaluation Protocol=Zero-shot2024.05 | 35.4 | |
| OpenSeeDBackbone=Swin-L, Pre-training data=COCO, O365, Evaluation Protocol=Zero-shot2024.05 | 23 | |
| DINOvBackbone=Swin-L, Pre-training data=COCO, SA-1B, Evaluation Protocol=Zero-shot2024.05 | 15.7 |