Object Detection on LVIS Mini v1.0 (val)
43.4APMQ-GLIP-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MQ-GLIP-LBackbone=Swin-L, Pre-Train Data=O365, Data Size=0.66M, Training Time (V100 days)=22, #Vision Query=52023.05 | 43.4 | 34.5 | 41.2 | 46.9 | |
| GLIP-LBackbone=Swin-L2021.12 | 37.3 | 28.2 | 34.3 | 41.5 | |
| GLIP-LBackbone=Swin-L, Pre-Train Data=FourODs, GoldG, Cap24M, Data Size=27.5M, Training Time (V100 days)=600, #Vision Query=02023.05 | 37.3 | 28.2 | 34.3 | 41.5 | |
| GroundingDINO-LBackbone=Swin-L, Pre-Train Data=O365, OI, GoldG, Cap4M, COCO, RefC, Data Size=15.8M, #Vision Query=02023.05 | 33.9 | 22.2 | 30.7 | 38.8 | |
| MaskRCNNBackbone=RN1012021.12 | 33.3 | 26.3 | 34 | 33.9 | |
| Mask R-CNNBackbone=RN101, #Vision Query=02023.05 | 33.3 | 26.3 | 34 | 33.9 | |
| MQ-GLIP-TBackbone=Swin-T, Pre-Train Data=O365, Data Size=0.66M, Training Time (V100 days)=10, #Vision Query=52023.05 | 30.4 | 21 | 27.5 | 34.6 | |
| MQ-GroundingDINO-TBackbone=Swin-T, Pre-Train Data=O365+, Data Size=0.66M, Training Time (V100 days)=10, #Vision Query=52023.05 | 30.2 | 21.7 | 26.2 | 35.2 | |
| GLIPv2-TBackbone=Swin-T, Pre-Train Data=O365, GoldG, CC4M, Data Size=5.5M, #Vision Query=02023.05 | 29 | — | — | — | |
| GLIP-TBackbone=Swin-T2021.12 | 26 | 20.8 | 21.4 | 31 | |
| GLIP-TBackbone=Swin-T, Pre-Train Data=O365, GoldG, CC4M, Data Size=5.5M, Training Time (V100 days)=480, #Vision Query=02023.05 | 26 | 20.8 | 21.4 | 31 | |
| MQ-GLIP-T-TxtBackbone=Swin-T, Pre-Train Data=O365, Data Size=0.66M, Training Time (V100 days)=10, #Vision Query=02023.05 | 26 | 20.8 | 21.4 | 31 | |
| Grounding DINO-TBackbone=Swin-T, Pre-Train Data=O365, GoldG, Cap4M, Data Size=5.5M, #Vision Query=02023.05 | 25.7 | 15.2 | 21.9 | 30.9 | |
| GLIP-T (C)Backbone=Swin-T2021.12 | 24.9 | 17.7 | 19.5 | 31 | |
| MDETRBackbone=RN1012021.12 | 24.2 | 20.9 | 24.9 | 24.3 | |
| MDETRBackbone=RN101, Pre-Train Data=GoldG,RefC, Data Size=0.9M, Training Time (V100 days)=400, #Vision Query=02023.05 | 24.2 | 20.9 | 24.9 | 24.3 | |
| K-LITEText Encoding=parallel, Zero-shot=true, Training Knowledge=Wiktionary, Evaluation Knowledge Source=S_wn_def2022.04 | 21.4 | — | — | — | |
| K-LITEText Encoding=parallel, Zero-shot=true, Training Knowledge=Wiktionary, Evaluation Knowledge Source=S_LVIS2022.04 | 21.3 | — | — | — | |
| K-LITEText Encoding=parallel, Zero-shot=true, Training Knowledge=Wiktionary, Evaluation Knowledge Source=S_wiki_def2022.04 | 20.5 | — | — | — | |
| K-LITEText Encoding=parallel, Zero-shot=true, Training Knowledge=Wiktionary, Evaluation Knowledge Source=S_wn_path2022.04 | 18.7 | — | — | — | |
| GLIP-T (A)Backbone=Swin-T2021.12 | 18.5 | 14.2 | 13.9 | 23.4 | |
| GLIP-AText Encoding=sequential, Zero-shot=true2022.04 | 18.5 | 14.2 | 13.9 | 23.4 | |
| Baseline GLIPText Encoding=parallel, Zero-shot=true2022.04 | 17.9 | 8.6 | 14 | 23.1 | |
| GLIP-T (B)Backbone=Swin-T2021.12 | 17.8 | 13.5 | 12.8 | 22.2 | |
| GLIP-T (B)Backbone=Swin-T, Pre-Train Data=O365, Data Size=0.66M, Training Time (V100 days)=300, #Vision Query=02023.05 | 17.8 | 13.5 | 12.8 | 22.2 | |
| Baseline GLIPText Encoding=parallel, Zero-shot=true, Knowledge Source=S_LVIS2022.04 | 17.6 | — | — | — | |
| MQ-GLIP-T-ImgBackbone=Swin-T, Pre-Train Data=O365+, Data Size=0.66M, Training Time (V100 days)=10, #Vision Query=52023.05 | 17.6 | 12 | 14.5 | 21.2 | |
| Baseline GLIPText Encoding=parallel, Zero-shot=true, Knowledge Source=S_wn_def2022.04 | 17.2 | — | — | — | |
| Baseline GLIPText Encoding=parallel, Zero-shot=true, Knowledge Source=S_wn_path2022.04 | 17.1 | — | — | — | |
| K-LITEText Encoding=parallel, Zero-shot=true, Training Knowledge=Wiktionary2022.04 | 16.9 | 14.8 | 18.6 | 24.8 | |
| Baseline GLIPText Encoding=parallel, Zero-shot=true, Knowledge Source=S_wiki_def2022.04 | 15 | — | — | — |