Object Detection on LVIS 1.0 (minival)
60.1APDetCLIPv2-L
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| DetCLIPv2-LEvaluation Protocol=Fine-tuning, Mask Annotation Usage=false2023.04 | 60.1 | 58.3 | 61.7 | 59.1 | — | — | — | — | |
| GLIPv2-HEvaluation Protocol=Fine-tuning, Mask Annotation Usage=true2023.04 | 59.8 | — | — | — | — | — | — | — | |
| GLIPv2-BEvaluation Protocol=Fine-tuning, Mask Annotation Usage=true2023.04 | 57.3 | — | — | — | — | — | — | — | |
| FIBER-Bprotocol=Fine-tune, scale=Larger size/More data2022.06 | 56.9 | 50 | 56.9 | 58.1 | — | — | — | — | |
| GLIP-Bprotocol=Fine-tune2022.06 | 51 | 31.3 | 48.3 | 56.9 | — | — | — | — | |
| DetCLIPv2-TEvaluation Protocol=Fine-tuning, Mask Annotation Usage=false2023.04 | 50.7 | 44.3 | 52.4 | 50.3 | — | — | — | — | |
| GLIPv2-TEvaluation Protocol=Fine-tuning, Mask Annotation Usage=true2023.04 | 50.6 | — | — | — | — | — | — | — | |
| ATSSBackbone=Swin-L, Pre-train Data=LVIS, Zero-shot=true2022.09 | 43.9 | 30.6 | 43.7 | 46.3 | — | — | — | — | |
| DetCLIP-LBackbone=Swin-L, Pre-train Data=O365, GoldG, YFCC1M, Zero-shot=true2022.09 | 38.6 | 36 | 38.3 | 39.3 | — | — | — | — | |
| GLIP-LBackbone=Swin-L+DH+F, Pre-train Data=4ODs, GoldG, Cap24M, Zero-shot=true2022.09 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| GLIP-Lprotocol=Zero-shot, scale=Larger size/More data2022.06 | 37.3 | 28.2 | 34.3 | 41.5 | — | — | — | — | |
| DetCLIP-TBackbone=Swin-T, Pre-train Data=O365, GoldG, YFCC1M, Zero-shot=true2022.09 | 35.9 | 33.2 | 35.7 | 36.4 | — | — | — | — | |
| FIBER-Bprotocol=Zero-shot, scale=Larger size/More data2022.06 | 35.8 | 29.5 | 32.2 | 40.1 | — | — | — | — | |
| DetCLIP-T(B)Backbone=Swin-T, Pre-train Data=O365, GoldG, Zero-shot=true2022.09 | 34.4 | 26.9 | 33.9 | 36.3 | — | — | — | — | |
| MASK-RCNNBackbone=Swin-T, Pre-train Data=LVIS, Zero-shot=true2022.09 | 34.1 | 19.1 | 34 | 37 | — | — | — | — | |
| OV-DEIM-LBackbone=ViT-S, Params=36M, Pre-trained Data=OG, FPS=912026.03 | 33.7 | 34.3 | 33.4 | 34 | 35.9 | 36.8 | 35.5 | 36 | |
| ATSSBackbone=Swin-T, Pre-train Data=LVIS, Zero-shot=true2022.09 | 33.6 | 19.7 | 32.4 | 37.2 | — | — | — | — | |
| Mask R-CNNprotocol=Fine-tune2022.06 | 33.3 | 26.3 | 34 | 33.9 | — | — | — | — | |
| YOLOEv8-LBackbone=YOLOv8-L, Params=45M, Pre-trained Data=OG, FPS=103/17*2026.03 | 33.3 | 30.8 | 32.2 | 34.6 | 35.9 | 33.2 | 34.8 | 37.3 | |
| YOLOEv11-LBackbone=YOLOv11-L, Params=26M, Pre-trained Data=OG, FPS=122/17*2026.03 | 32.4 | 25.6 | 31.9 | 34.1 | 35.2 | 29.1 | 35 | 36.5 | |
| OV-DEIM-MBackbone=ViT-T+, Params=20M, Pre-trained Data=OG, FPS=1092026.03 | 30.6 | 25.3 | 30.2 | 31.9 | 32.6 | 26.9 | 31.5 | 34.1 | |
| YOLOEv11-MBackbone=YOLOv11-M, Params=21M, Pre-trained Data=OG, FPS=151/18*2026.03 | 30.5 | 22.4 | 30.4 | 32.1 | 33 | 26.9 | 32.5 | 34.5 | |
| YOLOEv8-MBackbone=YOLOv8-M, Params=27M, Pre-trained Data=OG, FPS=145/17*2026.03 | 29.9 | 23.6 | 29.2 | 31.7 | 32.6 | 26.9 | 31.9 | 34.4 | |
| GLIP-Bprotocol=Zero-shot2022.06 | 29.1 | 17 | 23.9 | 35.9 | — | — | — | — | |
| GLIPv2-TBackbone=Swin-T+DH+F, Pre-train Data=O365, GoldG, Cap4M, Zero-shot=true2022.09 | 29 | — | — | — | — | — | — | — | |
| DetCLIP-T(A)Backbone=Swin-T, Pre-train Data=O365, Zero-shot=true2022.09 | 28.8 | 26 | 28 | 30 | — | — | — | — | |
| OV-DEIM-SBackbone=ViT-T, Params=11M, Pre-trained Data=OG, FPS=1612026.03 | 27.7 | 23.6 | 28.1 | 28 | 29.6 | 25.2 | 30.2 | 30 | |
| GLIP-TBackbone=Swin-T+DH+F, Pre-train Data=O365, GoldG, Cap4M, Zero-shot=true2022.09 | 26 | 20.8 | 21.4 | 31 | — | — | — | — | |
| YOLOEv8-SBackbone=YOLOv8-S, Params=12M, Pre-trained Data=OG, FPS=216/18*2026.03 | 25.7 | 19 | 25.9 | 26.7 | 27.9 | 22.3 | 27.8 | 29 | |
| YOLOEv11-SBackbone=YOLOv11-S, Params=10M, Pre-trained Data=OG, FPS=216/18*2026.03 | 25.2 | 19.3 | 24.4 | 26.7 | 27.5 | 21.4 | 26.8 | 29.3 | |
| GLIP-T(C)Backbone=Swin-T+DH+F, Pre-train Data=O365, GoldG, Zero-shot=true2022.09 | 24.9 | 17.7 | 19.5 | 31 | — | — | — | — | |
| GLIP-Tprotocol=Zero-shot2022.06 | 24.9 | 17.7 | 19.5 | 31 | — | — | — | — | |
| MDETRBackbone=RN101, Pre-train Data=GoldG+, Zero-shot=true2022.09 | 24.2 | 20.9 | 24.3 | 24.2 | — | — | — | — | |
| MDETRprotocol=Fine-tune2022.06 | 24.2 | 20.9 | 24.9 | 24.3 | — | — | — | — | |
| GLIP-T(A)Backbone=Swin-T+DH+F, Pre-train Data=O365, Zero-shot=true2022.09 | 18.5 | 14.2 | 13.9 | 23.4 | — | — | — | — | |
| G1.5-EdgeBackbone=EfficientViT-L1, Pre-trained Data=G-20M2026.03 | — | — | — | — | 33.5 | 28 | 34.3 | 33.9 | |
| GDINO-TBackbone=Swin-T, Params=172M, Pre-trained Data=OG2026.03 | — | — | — | — | 25.6 | 14.4 | 19.6 | 32.2 | |
| GDINO-TBackbone=Swin-T, Params=172M, Pre-trained Data=OG,Cap4M2026.03 | — | — | — | — | 27.4 | 18.1 | 23.3 | 32.7 | |
| GLIP-TBackbone=Swin-T, Params=232M, Pre-trained Data=OG2026.03 | — | — | — | — | 24.9 | 17.7 | 19.5 | 31 | |
| GLIP-TBackbone=Swin-T, Params=232M, Pre-trained Data=OG,Cap4M2026.03 | — | — | — | — | 26 | 20.8 | 21.4 | 31 | |
| GLIPv2-TBackbone=Swin-T, Params=232M, Pre-trained Data=OG,Cap4M2026.03 | — | — | — | — | 29 | — | — | — | |
| YOLO-Worldv2-LBackbone=YOLOv8-L, Params=48M, Pre-trained Data=OG2026.03 | — | — | — | — | 35.5 | 25.6 | 34.6 | 38.1 | |
| YOLO-Worldv2-MBackbone=YOLOv8-M, Params=29M, Pre-trained Data=OG2026.03 | — | — | — | — | 32.4 | 28.4 | 29.6 | 35.5 | |
| YOLO-Worldv2-SBackbone=YOLOv8-S, Params=13M, Pre-trained Data=OG2026.03 | — | — | — | — | 24.4 | 17.1 | 22.5 | 27.3 |