Object Detection on ODinW-35
70.6APGrounding DINO 1.5 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=fine-tuned2024.05 | 70.6 | |
| DetCLIPv3Backbone=Swin-L2024.05 | 70.4 | |
| DINO-Swin-LLanguage Query=false, Vision Query=false, Backbone=Swin-L, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 68.8 | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Full-Shot2023.05 | 67.1 | |
| DINO-Swin-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 66.7 | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 64.8 | |
| DyHead-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 63.2 | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Full-Shot2023.05 | 62.6 | |
| CP-DETR-L*Open Source=N, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.3M, Training Data=O365, OpenImages, GoldG, V3Det2026.04 | 50.6 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 49.7 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 48.3 | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 43 | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 42.4 | |
| DINO-Swin-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 41.2 | |
| CP-DETR-TOpen Source=N, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.3M, Training Data=O365, OpenImages, GoldG, V3Det2026.04 | 41 | |
| T-Rex2Open Source=N, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 39.7 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-L, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 39 | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 38.9 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 38.8 | |
| T-Rex2Open Source=N, Prompt Type=Visual-I, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 37.7 | |
| DyHead-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 37.5 | |
| Grounding DINO 1.5 ProBackbone=ViT-L [6], Pre-training data=Grounding-20M, Evaluation Protocol=Zero-shot2024.05 | 30.2 | |
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=zero-shot2024.05 | 30.2 | |
| Grounding DINOBackbone=Swin-L [19], Pre-training data=O365, OID, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Supervised2024.05 | 29.4 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 28.6 | |
| MM-G-T(c3)Backbone=Swin-T, Zero-shot=true2024.01 | 28.4 | |
| T-Rex2Open Source=N, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 27.8 | |
| Grounding-DINOBackbone=Swin-L, Resolution=800*1333, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 26.1 | |
| Grounding DINOPrompt Type=Text, Backbone=Swin-L, Training Data=O365, OpenImages, GoldG, Zero-shot=true2026.04 | 26.1 | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 25.8 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=-, Data Size=2.5M, Training Data=O365, OpenImages, V3Det2026.04 | 25.5 | |
| DetCLIPBackbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 24.9 | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 24.6 | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 24.6 | |
| OWL-STBackbone=CLIP L/14 [23], Pre-training data=WebLI2B, Evaluation Protocol=Zero-shot2024.05 | 24.4 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-L, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 24.2 | |
| MQ-GLIP-LLanguage Query=true, Vision Query=true, Backbone=Swin-L, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 23.9 | |
| MQ-GLIPBackbone=Swin-L, Pre-training data=O365, Evaluation Protocol=Zero-shot2024.05 | 23.9 | |
| MM-Grounding-DINOPrompt Type=Text, Backbone=Swin-L, Training Data=O365V2, OpenImage, GoldG, Zero-shot=true2026.04 | 23.9 | |
| LLMDetBackbone=Swin-T, Zero-shot transfer=true2025.01 | 23.8 | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 23.8 | |
| T-Rex2Open Source=N, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=CLIP, Data Size=3.1M, Training Data=O365, OpenImages, HierText, CrowdHuman, SA-1B2026.04 | 23.6 | |
| MM-GDINOBackbone=Swin-T, Zero-shot transfer=true2025.01 | 23.1 | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 23.1 | |
| PET-DINOPrompt Type=Text, Backbone=Swin-L, Training Data=O365†, Zero-shot=true2026.04 | 23.1 | |
| MM-G-T(c1)Backbone=Swin-T, Zero-shot=true2024.01 | 22.8 | |
| MM-G-T(c2)Backbone=Swin-T, Zero-shot=true2024.01 | 22.8 | |
| G-DINO-T(c)Backbone=Swin-T, Zero-shot=true2024.01 | 22.7 | |
| Grounding-DINOBackbone=Swin-T, Zero-shot transfer=true2025.01 | 22.7 | |
| Grounding-DINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 22.7 | |
| GLIP-LLanguage Query=true, Vision Query=false, Backbone=Swin-L, Pre-train Data=FourODs, GoldG, Cap24M, Data Size=27.5M, Evaluation Setting=Finetuning-free2023.05 | 22.6 | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 22.6 | |
| MQ-GroundingDINO-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 22.5 | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, RefC, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 22.4 | |
| GLIPv2-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 22.3 | |
| GLIPv2Backbone=Swin-T, Zero-shot transfer=true2025.01 | 22.3 | |
| GDINO-TBackbone=Swin-T, Pre-train Data=OG, Cap4M, #Params=172M, Resolution=800x1333, Zero-shot=true2026.01 | 22.3 | |
| Grounding DINOPrompt Type=Text, Backbone=Swin-T, Training Data=O365, GoldG, Cap4M, Zero-shot=true2026.04 | 22.3 | |
| T-Rex2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 22 | |
| T-Rex2 (visual)Backbone=Swin-L, Pre-training data=O365, OID, HierText, CrowdHuman, SA-1B, Evaluation Protocol=Zero-shot2024.05 | 22 | |
| Grounding DINO-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 21.7 | |
| MM-Grounding-DINOPrompt Type=Text, Backbone=Swin-T, Training Data=O365, GoldG, V3Det, Zero-shot=true2026.04 | 21.4 | |
| WeDetect-TinyBackbone=ConvNext-T, Resolution=640*640, #Params=33M, FPS=62.5, Zero-shot=true2025.12 | 21.1 | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 20.8 | |
| PET-DINOPrompt Type=Text, Backbone=Swin-T, Training Data=O365†, Zero-shot=true2026.04 | 20.6 | |
| PET-DINOOpen Source=Y, Prompt Type=Visual-G, Backbone=Swin-T, VLM sup.=-, Data Size=0.6M, Training Data=O3652026.04 | 20.4 | |
| MM-G-T(b)Backbone=Swin-T, Zero-shot=true2024.01 | 20.2 | |
| GLIPBackbone=Swin-T, Zero-shot transfer=true2025.01 | 19.6 | |
| GLIPBackbone=Swin-T, Resolution=800*1333, #Params=232M, FPS=5.4, Zero-shot=true2025.12 | 19.6 | |
| OWL-ViTLanguage Query=true, Vision Query=false, Backbone=ViT L/14(CLIP), Pre-train Data=O365, VG, Data Size=0.8M, Evaluation Setting=Finetuning-free2023.05 | 18.8 | |
| OWL-ViTBackbone=ViT L/14(CLIP), Zero-shot transfer=true2025.01 | 18.8 | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 18.7 | |
| T-Rex2Backbone=Swin-T, Zero-shot transfer=true2025.01 | 18 | |
| T-Rex2Backbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 18 | |
| YOLO-Worldv2-LBackbone=YOLOv8-L, Pre-train Data=OG, #Params=48M, Resolution=640x640, Zero-shot=true2026.01 | 17.1 | |
| YOLO-World-LBackbone=YOLOv8-L, Resolution=640*640, #Params=48M, FPS=54.6, Zero-shot=true2025.12 | 17.1 | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Finetuning-free2023.05 | 16 | |
| MDETRLanguage Query=true, Vision Query=false, Backbone=ENB5, Pre-train Data=GoldG,RefC, Data Size=0.9M, Evaluation Setting=Finetuning-free2023.05 | 10.7 | |
| MDETRBackbone=ENB5, Zero-shot transfer=true2025.01 | 10.7 |