Object Detection on ODinW (test)
70.7mAPGrounding DINO T
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Grounding DINO TLanguage Input=true, Backbone=Swin-T, Model Size=172M, Pre-Training Data=O365, GoldG, Evaluation Protocol=Full-Shot2023.03 | 70.7 | 76.2 | — | — | — | — | — | |
| Detic-BBackbone=Swin-B, Pre-training Data=LVIS, COCO, IN-21K, Evaluation Protocol=full-shot2024.04 | 70.1 | — | — | — | — | — | — | |
| HyperLearnerBackbone=Swin-T, Pre-training Data=O365, GoldG, Evaluation Protocol=full-shot2024.04 | 68.9 | — | — | — | — | — | — | |
| DINO-Swin-LLanguage Input=false, Backbone=Swin-L, Model Size=218M, Pre-Training Data=O365, Evaluation Protocol=Full-Shot2023.03 | 68.8 | 70.7 | — | — | — | — | — | |
| OmDetLanguage Input=true, Backbone=ConvNeXt-B, Model Size=230M, Pre-Training Data=COCO, O365, LVIS, PhraseCut, Evaluation Protocol=Full-Shot2023.03 | 67.1 | 71.2 | — | — | — | — | — | |
| HyperLearnerBackbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=full-shot2024.04 | 66.7 | — | — | — | — | — | — | |
| DINO-Swin-TLanguage Input=false, Backbone=Swin-T, Model Size=49M, Pre-Training Data=O365, Evaluation Protocol=Full-Shot2023.03 | 66.7 | 68.5 | — | — | — | — | — | |
| Detic-RBackbone=RN50, Pre-training Data=LVIS, COCO, IN-21K, Evaluation Protocol=full-shot2024.04 | 64.4 | — | — | — | — | — | — | |
| GLIP-T(C)Backbone=Swin-T, Pre-training Data=O365, GoldG, Evaluation Protocol=full-shot2024.04 | 63.9 | — | — | — | — | — | — | |
| GLIP-T(A)Backbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=full-shot2024.04 | 63.6 | — | — | — | — | — | — | |
| DyHead-TLanguage Input=false, Backbone=Swin-T, Model Size=≈100M, Pre-Training Data=O365, Evaluation Protocol=Full-Shot2023.03 | 63.2 | 64.9 | — | — | — | — | — | |
| GLIP-T(B)Backbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=full-shot2024.04 | 62.7 | — | — | — | — | — | — | |
| GLIP-TLanguage Input=true, Backbone=Swin-T, Model Size=232M, Pre-Training Data=O365, GoldG, Cap4M, Evaluation Protocol=Full-Shot2023.03 | 62.6 | 62.1 | — | — | — | — | — | |
| RegionSpot-Prozero-shot=true2023.11 | 46.9 | — | 14.2 | 27.2 | 62.7 | 69.3 | 61.3 | |
| Grounding DINO TLanguage Input=true, Backbone=Swin-T, Model Size=172M, Pre-Training Data=O365, GoldG, Evaluation Protocol=Few-Shot2023.03 | 46.4 | 51.1 | — | — | — | — | — | |
| HyperLearnerBackbone=Swin-T, Pre-training Data=O365, GoldG, Evaluation Protocol=zero-shot2024.04 | 45.2 | — | — | — | — | — | — | |
| Grounding-DINO-TBackbone=Swin-T, Pre-training Data=O365, GoldG, Cap4M, Evaluation Protocol=zero-shot2024.04 | 44.9 | — | — | — | — | — | — | |
| GLIP-T(C)Backbone=Swin-T, Pre-training Data=O365, GoldG, Evaluation Protocol=zero-shot2024.04 | 44.4 | — | — | — | — | — | — | |
| GLIP-Lzero-shot=true2023.11 | 44.4 | — | 7.1 | 26.9 | 61.7 | 68.9 | 57.3 | |
| OmDetLanguage Input=true, Backbone=ConvNeXt-B, Model Size=230M, Pre-Training Data=COCO, O365, LVIS, PhraseCut, Evaluation Protocol=Few-Shot2023.03 | 42.4 | 41.7 | — | — | — | — | — | |
| DINO-Swin-TLanguage Input=false, Backbone=Swin-T, Model Size=49M, Pre-Training Data=O365, Evaluation Protocol=Few-Shot2023.03 | 41.2 | 41.1 | — | — | — | — | — | |
| GLIP-TLanguage Input=true, Backbone=Swin-T, Model Size=232M, Pre-Training Data=O365, GoldG, Cap4M, Evaluation Protocol=Few-Shot2023.03 | 38.9 | 33.7 | — | — | — | — | — | |
| Detic-BBackbone=Swin-B, Pre-training Data=LVIS, COCO, IN-21K, Evaluation Protocol=zero-shot2024.04 | 38.7 | — | — | — | — | — | — | |
| HyperLearnerBackbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=zero-shot2024.04 | 37.9 | — | — | — | — | — | — | |
| DyHead-TLanguage Input=false, Backbone=Swin-T, Model Size=≈100M, Pre-Training Data=O365, Evaluation Protocol=Few-Shot2023.03 | 37.5 | 36.7 | — | — | — | — | — | |
| RegionSpot-Litezero-shot=true2023.11 | 35.7 | — | 13.1 | 20.1 | 58.2 | 30.1 | 57.2 | |
| GroundingDINO-Tzero-shot=true2023.11 | 34.3 | — | 10.3 | 17.5 | 55.7 | 29.5 | 58.5 | |
| GLIP-Tzero-shot=true2023.11 | 33.8 | — | 12.5 | 18.4 | 56.2 | 26.3 | 56 | |
| GLIP-T(B)Backbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=zero-shot2024.04 | 33.2 | — | — | — | — | — | — | |
| Detic-RBackbone=RN50, Pre-training Data=LVIS, COCO, IN-21K, Evaluation Protocol=zero-shot2024.04 | 29.4 | — | — | — | — | — | — | |
| GLIP-T(A)Backbone=Swin-T, Pre-training Data=O365, Evaluation Protocol=zero-shot2024.04 | 28.7 | — | — | — | — | — | — | |
| Grounding DINO LLanguage Input=true, Backbone=Swin-L, Model Size=341M, Pre-Training Data=O365, OI, GoldG, Cap4M, COCO, RefC, Evaluation Protocol=Zero-Shot2023.03 | 26.1 | 18.4 | — | — | — | — | — | |
| FlorenceLanguage Input=true, Backbone=CoSwinH, Model Size=≈841M, Pre-Training Data=FLD900M, O365, GoldG, Evaluation Protocol=Zero-Shot2023.03 | 25.8 | 14.3 | — | — | — | — | — | |
| DetCLIPLanguage Input=true, Backbone=Swin-L, Model Size=267M, Pre-Training Data=O365, GoldG, YFCC1M, Evaluation Protocol=Zero-Shot2023.03 | 24.9 | 18.3 | — | — | — | — | — | |
| GLIPv2-TLanguage Input=true, Backbone=Swin-T, Model Size=232M, Pre-Training Data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-Shot2023.03 | 22.3 | 8.9 | — | — | — | — | — | |
| Grounding DINO TLanguage Input=true, Backbone=Swin-T, Model Size=172M, Pre-Training Data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-Shot2023.03 | 22.3 | 11.9 | — | — | — | — | — | |
| Grounding DINO TLanguage Input=true, Backbone=Swin-T, Model Size=172M, Pre-Training Data=O365, GoldG, Evaluation Protocol=Zero-Shot2023.03 | 20 | 9.5 | — | — | — | — | — | |
| OmDetLanguage Input=true, Backbone=ConvNeXt-B, Model Size=230M, Pre-Training Data=COCO, O365, LVIS, Phrase Cut, Evaluation Protocol=Zero-Shot2023.03 | 19.7 | 10.8 | — | — | — | — | — | |
| GLIP-TLanguage Input=true, Backbone=Swin-T, Model Size=232M, Pre-Training Data=O365, GoldG, Cap4M, Evaluation Protocol=Zero-Shot2023.03 | 19.6 | 5.1 | — | — | — | — | — | |
| OWL-VITLanguage Input=true, Backbone=ViT L/14(CLIP), Model Size=>1243M, Pre-Training Data=O365, VG, Evaluation Protocol=Zero-Shot2023.03 | 18.8 | 9.8 | — | — | — | — | — | |
| MDETRLanguage Input=true, Backbone=ENB5, Model Size=169M, Pre-Training Data=GoldG, RefC, Evaluation Protocol=Zero-Shot2023.03 | 10.7 | 3 | — | — | — | — | — |