Object Detection on ODinW-13
72.4APGrounding DINO 1.5 Pro
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=fine-tuned2024.05 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L2024.04 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-L2024.05 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv3Backbone=Swin-T2024.04 | 71.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H2024.04 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-L2024.04 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H2024.05 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-ProBackbone=ViT-L2024.05 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L2024.04 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L2024.05 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPv2Backbone=Swin-T2024.04 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-Swin-LLanguage Query=false, Vision Query=false, Backbone=Swin-L, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 67.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-T2024.04 | 66.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Full-Shot2023.05 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-T2024.04 | 64.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 62.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Full-Shot2023.05 | 61.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APE (B)Backbone=ViT-L, Pre-training data=COCO, LVIS, O365, OID, VG, Evaluation Protocol=Supervised2024.05 | 59.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DyHead-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Full-Shot2023.05 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L [6], Pre-training data=Grounding-20M, Evaluation Protocol=Zero-shot2024.05 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO 1.5 ProBackbone=ViT-L, Evaluation Protocol=zero-shot2024.05 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOBackbone=Swin-L [19], Pre-training data=O365, OID, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Supervised2024.05 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOBackbone=Swin-L, Pre-training data=O365, OID, GoldG, Evaluation Protocol=Zero-shot2024.05 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDet-Turbo-BBackbone=ConvNeXt-B [20], Pre-training data=O365, GoldG, PhraseCut, Hake, HOI-A, Evaluation Protocol=Zero-shot2024.05 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIP-LLanguage Query=true, Vision Query=true, Backbone=Swin-L, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIPBackbone=Swin-L, Pre-training data=O365, Evaluation Protocol=Zero-shot2024.05 | 54.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-LargeBackbone=ConvNext-L, Resolution=1280*1280, #Params=490M, FPS=6, Zero-shot=true2025.12 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLEE-ProBackbone=ViT-L [6], Pre-training data=GLEE-merged-10M (COCO, LVIS, etc.), Evaluation Protocol=Supervised2024.05 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Zero-shot=true2024.01 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-L, Resolution=1000*1560, #Params=343M, FPS=2.1, Zero-shot=true2025.12 | 53.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-Bscale=Base2026.02 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-BaseBackbone=ConvNext-B, Resolution=640*640, #Params=176M, FPS=35.1, Zero-shot=true2025.12 | 53.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-ViTBackbone=ViT L/14(CLIP), Zero-shot transfer=true2025.01 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWL-STBackbone=CLIP L/14 [23], Pre-training data=WebLI2B, Evaluation Protocol=Zero-shot2024.05 | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H [32], Pre-training data=FourODS, COCO, GoldG, CC15M, SBU, Evaluation Protocol=Supervised2024.05 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Zero-shot transfer=true2025.01 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-GDINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 52.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G-DINO-L2026.01 | 52.4 | 12.6 | 28.1 | 71.7 | 52 | 72.3 | 63.9 | 66 | 71.4 | 30.4 | 65.8 | 62.5 | 21.3 | 62.7 | — | — | |
| LLMDetBackbone=Swin-T, Zero-shot transfer=true2025.01 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDet-Tscale=Tiny2026.02 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLMDetBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-L, Pre-training data=FourODs, GoldG, Cap24M, Evaluation Protocol=Zero-shot2024.05 | 52.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G-DINO-T(c)Backbone=Swin-T, Zero-shot=true2024.01 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding-DINOBackbone=Swin-T, Zero-shot transfer=true2025.01 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding-DINO-Tscale=Tiny2026.02 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding-DINOBackbone=Swin-T, Resolution=800*1333, #Params=172M, FPS=6, Zero-shot=true2025.12 | 51.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c1)Backbone=Swin-T, Zero-shot=true2024.01 | 51.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(c2)Backbone=Swin-T, Zero-shot=true2024.01 | 51.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-LLanguage Query=true, Vision Query=false, Backbone=Swin-L, Pre-train Data=FourODs, GoldG, Cap24M, Data Size=27.5M, Evaluation Setting=Finetuning-free2023.05 | 51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GroundingDINO-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 50.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ObjEmbed-4Bparameters=4B2026.02 | 50.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 50.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 50.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T-Rex2Backbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 50.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWLv2 (L/14)backbone=L/142026.02 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-L, Resolution=800*1333, Zero-shot=true2025.12 | 50 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ObjEmbed-2Bparameters=2B2026.02 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINOBackbone=Swin-T, Pre-training data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-shot2024.05 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GDINO-TBackbone=Swin-T, Pre-train Data=OG, Cap4M, #Params=172M, Resolution=800x1333, Zero-shot=true2026.01 | 49.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-Swin-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 48.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-T, Zero-shot transfer=true2025.01 | 48.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-Ref-2Bparameters=2B2026.02 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4Bparameters=4B2026.02 | 48.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ExpAlignBackbone=ConvNeXt-T, Pre-train Data=OG, RefC, #Params=60M, Resolution=640x640, Zero-shot=true2026.01 | 47.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-Ref-4Bparameters=4B2026.02 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniDetectorBackbone=ResNet50 [8], Pre-training data=COCO, O365, OID, Evaluation Protocol=Zero-shot2024.05 | 47.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-T, Zero-shot transfer=true2025.01 | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-Tscale=Tiny2026.02 | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIPBackbone=Swin-T, Resolution=800*1333, #Params=232M, FPS=5.4, Zero-shot=true2025.12 | 46.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WeDetect-TinyBackbone=ConvNext-T, Resolution=640*640, #Params=33M, FPS=62.5, Zero-shot=true2025.12 | 46.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MQ-GLIP-TLanguage Query=true, Vision Query=true, Backbone=Swin-T, Pre-train Data=O365+, Data Size=0.66M, Evaluation Setting=Finetuning-free2023.05 | 45.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-G-T(b)Backbone=Swin-T, Zero-shot=true2024.01 | 45.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLM-FO1-3Bparameters=3B2026.02 | 44 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmDetLanguage Query=true, Vision Query=false, Backbone=ConvNeXt-B, Pre-train Data=COCO, O365, LVIS, PhraseCut, Data Size=1.8M, Evaluation Setting=Finetuning-free2023.05 | 43.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-2Bparameters=2B2026.02 | 43.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, YFCC1M, Data Size=2.4M, Evaluation Setting=Finetuning-free2023.05 | 43.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Zero-shot transfer=true2025.01 | 43.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetCLIPBackbone=Swin-T, Resolution=800*1333, Zero-shot=true2025.12 | 43.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DyHead-TLanguage Query=false, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, Data Size=0.66M, Evaluation Setting=Few-Shot (3-shot)2023.05 | 43.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GLIP-TLanguage Query=true, Vision Query=false, Backbone=Swin-T, Pre-train Data=O365, GoldG, Cap4M, Data Size=5.5M, Evaluation Setting=Finetuning-free2023.05 | 41.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GeM-VG2026.01 | 41.1 | 3.4 | 25.6 | 77.4 | 51 | 20.6 | 51 | 54.1 | 57.5 | 12.1 | 36.2 | 40.6 | 44.3 | 60.3 | — | — | |
| OWL-ViTLanguage Query=true, Vision Query=false, Backbone=ViT L/14(CLIP), Pre-train Data=O365, VG, Data Size=0.8M, Evaluation Setting=Finetuning-free2023.05 | 40.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-Worldv2-LBackbone=YOLOv8-L, Pre-train Data=OG, #Params=48M, Resolution=640x640, Zero-shot=true2026.01 | 38.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLO-World-LBackbone=YOLOv8-L, Resolution=640*640, #Params=48M, FPS=54.6, Zero-shot=true2025.12 | 38.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B2026.01 | 37.2 | 6.2 | 16.4 | 75 | 24.6 | 8.3 | 66.6 | 52 | 42.3 | 10.2 | 47.7 | 36.7 | 40.7 | 57.1 | — | — | |
| Qwen2.5-VL-7Breproduced=true2026.01 | 37 | 7.8 | 20.3 | 73.5 | 32.2 | 7 | 57.6 | 49.8 | 48.5 | 7.4 | 40.1 | 42.7 | 38 | 56.3 | — | — | |
| UniVG-R1reproduced=true2026.01 | 33.3 | 0.6 | 10.5 | 66.5 | 1.1 | 30.8 | 52.5 | 44.2 | 50.7 | 10.9 | 40.5 | 36.7 | 37.2 | 51 | — | — | |
| Qwen2-VL-7Breproduced=true2026.01 | 32 | 4.9 | 14.2 | 65.8 | 11.8 | 3.7 | 47.5 | 44.4 | 52.1 | 12.1 | 40.3 | 38.9 | 32.2 | 48.6 | — | — | |
| DINOvBackbone=Swin-L, Pre-training data=COCO, SA-1B, Evaluation Protocol=Zero-shot2024.05 | 27.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ferret-13Breproduced=true2026.01 | 27.1 | 0 | 4.3 | 59.8 | 1.5 | 6.1 | 40.1 | 35.2 | 41.5 | 3.9 | 49.5 | 29.5 | 36.5 | 44.4 | — | — | |
| MDETRLanguage Query=true, Vision Query=false, Backbone=ENB5, Pre-train Data=GoldG,RefC, Data Size=0.9M, Evaluation Setting=Finetuning-free2023.05 | 25.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MDETR2026.01 | 22.2 | 0.6 | 1.7 | 66.5 | 5.9 | 39.8 | 63.6 | 5.6 | 15.9 | 12.7 | 50.6 | 8.1 | 4.5 | 13.4 | — | — | |
| Migicianreproduced=true2026.01 | 21.9 | 0.9 | 4.3 | 54.5 | 2.9 | 17.6 | 15.1 | 28.7 | 36.7 | 5 | 33.3 | 28.9 | 23 | 33.6 | — | — | |
| InternVL2.5-8Breproduced=true2026.01 | 20.2 | 0 | 6.9 | 38.5 | 0.2 | 26.7 | 16.4 | 37 | 29.2 | 1.1 | 46.6 | 28.5 | 3.8 | 27.1 | — | — | |
| CleanLVLM Model=Qwen3-VL-8B, Perturbation budget (ε)=8/255, Iterations (S)=3002026.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 35.5 | 0 | |
| PA-AttackLVLM Model=Qwen3-VL-8B, Perturbation budget (ε)=8/255, Iterations (S)=S1=100, S2=2002026.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 9.8 | 38 |