Object Detection on COCO v2017 (test-dev)
65.4mAPInternImage-H#
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| InternImage-H#detector=DINO, #params=2.18B2022.11 | 65.4 | — | — | — | — | — | — | — | — | — | — | |
| ViT-Hugedetector=Group-DETRv2, #params=629M2022.11 | 64.5 | — | — | — | — | — | — | — | — | — | — | |
| FocalNet-H‡detector=DINO, #params=746M2022.11 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| InternImage-XL‡detector=DINO, #params=602M2022.11 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| FD-SwinV2-G#detector=HTC++, #params=3.00B2022.11 | 64.2 | — | — | — | — | — | — | — | — | — | — | |
| BEIT-3Extra OD Data=Object365, Maximum Image Size=1280, Detection Head=Cascade Mask R-CNN, Evaluation=multi-scale2022.08 | 63.7 | — | — | — | — | — | — | — | — | — | — | |
| BEiT-3#detector=ViTDet, #params=1.90B2022.11 | 63.7 | — | — | — | — | — | — | — | — | — | — | |
| DINOExtra OD Data=Object365, Maximum Image Size=20002022.08 | 63.3 | — | — | — | — | — | — | — | — | — | — | |
| Swin-L‡detector=DINO, #params=218M2022.11 | 63.3 | — | — | — | — | — | — | — | — | — | — | |
| DINOBackbone=Swin-L, Backbone Pre-training=IN-22K, Full model Pre-training=Object365, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 63.2 | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-GExtra OD Data=Object365, Maximum Image Size=15362022.08 | 63.1 | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-G#detector=HTC++, #params=3.00B2022.11 | 63.1 | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO LBackbone=Swin-L, Pre-Training Data=O365, OI, GoldG, Protocol=Fine-Tuning, Image Size=1.5x (2000)2023.03 | 63 | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO LBackbone=Swin-L, Pre-Training Data=O365, OI, GoldG, Protocol=Fine-Tuning2023.03 | 62.7 | — | — | — | — | — | — | — | — | — | — | |
| ViT-L‡detector=ViT-Adapter, #params=401M2022.11 | 62.6 | — | — | — | — | — | — | — | — | — | — | |
| Grounding DINO LBackbone=Swin-L, Pre-Training Data=O365, OI, GoldG, Cap4M, COCO, RefC, Protocol=Fine-Tuning2023.03 | 62.6 | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Extra OD Data=FourODs2022.08 | 62.4 | — | — | — | — | — | — | — | — | — | — | |
| FlorenceExtra OD Data=FLOD-9M, Maximum Image Size=25002022.08 | 62.4 | — | — | — | — | — | — | — | — | — | — | |
| Florence-CoSwin-H#detector=DyHead, #params=637M2022.11 | 62.4 | — | — | — | — | — | — | — | — | — | — | |
| FlorenceDetector=DyHead2023.02 | 62 | — | — | — | — | — | — | — | — | — | — | |
| GLIP-LBackbone=Swin-L, Pre-Train Data=FourODs, GoldG+, COCO, Evaluation Protocol=Fine-Tune2021.12 | 61.5 | — | — | — | — | — | — | — | — | — | — | |
| GLIPExtra OD Data=FourODs2022.08 | 61.5 | — | — | — | — | — | — | — | — | — | — | |
| Soft Teacherdetector=HTC++, backbone=Swin-L, scale=multi-scale, pre-training=Object365 [24]2021.06 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| SoftTeacherBackbone=Swin-L, Pre-Train Data=O365, SS-COCO, Evaluation Protocol=Fine-Tune2021.12 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| Soft TeacherExtra OD Data=Object3652022.08 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| Swin-L‡detector=Soft-Teacher, #params=284M2022.11 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| Soft TeacherBackbone=Swin-L, Pre-Training Data=O365, SS-COCO, Protocol=Fine-Tuning2023.03 | 61.3 | — | — | — | — | — | — | — | — | — | — | |
| GLIP-LBackbone=Swin-L, Pre-Train Data=FourODs, GoldG, Cap24M, Evaluation Protocol=Fine-Tune2021.12 | 61 | — | — | — | — | — | — | — | — | — | — | |
| GLIP-LBackbone=Swin-L, Pre-Training Data=FourODs, GoldG, Cap24M, Protocol=Fine-Tuning2023.03 | 61 | — | — | — | — | — | — | — | — | — | — | |
| GLIPDetector=DyHead2023.02 | 60.8 | — | — | — | — | — | — | — | — | — | — | |
| DyHead-LBackbone=Swin-L, Pre-Train Data=O365, ImageNet21K, Evaluation Protocol=Fine-Tune2021.12 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| DyHeadExtra OD Data=ImageNet-Pseudo Labels, Maximum Image Size=20002022.08 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| GLIPv2Backbone=Swin-H, Backbone Pre-training=CC-15M+ IN-22K, Full model Pre-training=Object365, FourODs, GoldG, CC15M+SBU, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| DyHead-LBackbone=Swin-L, Pre-Training Data=O365, ImageNet21K, Protocol=Fine-Tuning2023.03 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| Soft Teacherdetector=HTC++, backbone=Swin-L, scale=multi-scale2021.06 | 60.4 | — | — | — | — | — | — | — | — | — | — | |
| GRITBackbone=ViT-H, Backbone Pre-training=IN-1K, Full model Pre-training=Object365, Testing Scale=single-scale, Framework=Open-Set2022.12 | 60.4 | 78.1 | 66 | — | — | — | — | — | — | — | — | |
| SwinV2-LDetector=HTC++2023.02 | 60.2 | — | — | — | — | — | — | — | — | — | — | |
| ViT-AdapterMaximum Image Size=16002022.08 | 60.1 | — | — | — | — | — | — | — | — | — | — | |
| CBNetV2Detector=HTC2023.02 | 59.6 | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=HTC++, Epoch=36, Pre-train=MM, BEiTv22022.05 | 59.5 | — | — | — | — | — | — | — | — | — | 60.9 | |
| CBV2-Swin-LFramework=HTC, Epoch=36, Pre-train=IN-22K, supervised2022.05 | 59.4 | — | — | — | — | — | — | — | — | — | 60.1 | |
| GRITBackbone=ViT-H, Backbone Pre-training=IN-1K, Testing Scale=single-scale, Framework=Open-Set2022.12 | 59 | 76.9 | 64.5 | — | — | — | — | — | — | — | — | |
| Superviseddetector=HTC++, backbone=Swin-L, scale=multi-scale2021.06 | 58.9 | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LBackbone=ViT-L, Backbone Pre-training=IN-22K, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 58.9 | — | — | — | — | — | — | — | — | — | — | |
| ViT-Adapter-LFramework=HTC++, Epoch=36, Pre-train=IN-22K, BEIT2022.05 | 58.9 | — | — | — | — | — | — | — | — | — | 60.4 | |
| DyHead-LBackbone=Swin-L, Pre-Train Data=None, Evaluation Protocol=Fine-Tune2021.12 | 58.7 | — | — | — | — | — | — | — | — | — | — | |
| DyHeadBackbone=Swin-L, Backbone Pre-training=IN-22K, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 58.7 | 77.1 | 64.5 | — | — | — | — | — | — | — | — | |
| Swin-L‡detector=HTC++, #params=284M2022.11 | 58.7 | — | — | — | — | — | — | — | — | — | — | |
| DyHead-LBackbone=Swin-L, Protocol=Fine-Tuning2023.03 | 58.7 | — | — | — | — | — | — | — | — | — | — | |
| Swin-Ldetector=DyHead, #params=213M2022.11 | 58.4 | — | — | — | — | — | — | — | — | — | — | |
| Swin-LDetector=HTC++2023.02 | 58 | — | — | — | — | — | — | — | — | — | — | |
| HTC++Backbone=Swin-L, Backbone Pre-training=IN-22K, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 57.7 | — | — | — | — | — | — | — | — | — | — | |
| Swin-LFramework=HTC++, Epoch=72, Pre-train=IN-22K, supervised2022.05 | 57.7 | — | — | — | — | — | — | — | — | — | 58.7 | |
| ViT-Adapter-LFramework=HTC++, Epoch=36, Pre-train=IN-22K, supervised2022.05 | 57.4 | — | — | — | — | — | — | — | — | — | 58.4 | |
| Copy-PasteDetector=Cascade2023.02 | 57 | — | — | — | — | — | — | — | — | — | — | |
| GRITBackbone=ViT-L, Backbone Pre-training=IN-1K, Testing Scale=single-scale, Framework=Open-Set2022.12 | 56.6 | 74.5 | 61.8 | — | — | — | — | — | — | — | — | |
| SOLQBackbone=Swin-L, Epochs=502021.06 | 56.5 | — | — | 37.6 | 60 | 70.6 | — | — | — | — | — | |
| CenterNet2Backbone=Res2Net, Backbone Pre-training=IN-1K, Full model Pre-training=Unlabeled COCO, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 56.4 | 74 | 61.6 | — | — | — | — | — | — | — | — | |
| QueryInstBackbone=Swin-L, Epochs=502021.06 | 56.1 | — | — | — | — | — | — | — | — | — | — | |
| EfficientDet-D7xInput Resolution=1536, Params=77M, FLOPs=410B, Latency (TitanV)=285ms, Latency (V100)=153ms2019.11 | 55.1 | 74.3 | 59.9 | — | — | — | — | — | — | — | — | |
| EfficientDet-D7xBackbone=EfficientNet-B7, Backbone Pre-training=IN-1K, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 55.1 | 74.3 | 59.9 | — | — | — | — | — | — | — | — | |
| PP-YOLOE+-xBackbone=CSPRepResNet, Size=640, Pre-trained=Objects3652022.03 | 54.7 | 72 | 59.9 | 37.9 | 59.3 | 70.4 | — | — | 45 | 95.2 | — | |
| GRITBackbone=ViT-B, Backbone Pre-training=IN-1K, Testing Scale=single-scale, Framework=Open-Set2022.12 | 53.8 | 71.8 | 58.7 | — | — | — | — | — | — | — | — | |
| EfficientDet-D7Input Resolution=1536, Params=52M, FLOPs=325B, Latency (TitanV)=232ms, Latency (V100)=122ms2019.11 | 53.7 | 72.4 | 58.4 | — | — | — | — | — | — | — | — | |
| PP-YOLOE+-lBackbone=CSPRepResNet, Size=640, Pre-trained=Objects3652022.03 | 52.9 | 70.1 | 57.9 | 35.2 | 57.5 | 69.1 | — | — | 78.1 | 149.2 | — | |
| EfficientDet-D6Input Resolution=1280, Params=52M, FLOPs=226B, Latency (TitanV)=169ms, Latency (V100)=92.8ms2019.11 | 52.6 | 71.5 | 57.2 | — | — | — | — | — | — | — | — | |
| GCNetBackbone=ResNeXt-101 64x4d, Cascade strategy=true, Deformable Convolution (DCN)=true, Head type=4conv1fc, Multiscale training=true, Training schedule=3x schd, GC ratio=r4, FLOPs(G)=1040.6G2020.12 | 52.3 | 70.9 | 56.9 | — | — | — | — | — | — | — | — | |
| Deformable DETRBackbone=ResNeXt-101 + DCN, TTA=true2020.10 | 52.3 | 71.9 | 58.1 | 34.4 | 54.4 | 65.6 | — | — | — | — | — | |
| EfficientDet-D7Backbone=EfficientNet-B6, TTA=false2020.10 | 52.2 | 71.4 | 56.3 | — | — | — | — | — | — | — | — | |
| PP-YOLOE-xBackbone=CSPRepResNet, Size=6402022.03 | 52.2 | 69.9 | 56.5 | 33.3 | 56.3 | 66.4 | — | — | 45 | 95.2 | — | |
| EfficientDet-D5Input Resolution=1280, Params=34M, FLOPs=135B, Latency (TitanV)=128ms, Latency (V100)=72.5ms2019.11 | 51.5 | 70.5 | 56.1 | — | — | — | — | — | — | — | — | |
| OTAIteration=180k, Backbone=ResNeXt-64x4d-101-DCN, multi-scale testing=true2021.03 | 51.5 | 68.6 | 57.1 | 34.1 | 53.7 | 64.1 | — | — | — | — | — | |
| EfficientDetBackbone=EfficientNet-B5, TTA=false2020.11 | 51.5 | 70.5 | 56.1 | — | — | — | — | — | — | — | — | |
| Sparse R-CNNBackbone=ResNeXt-101-DCN, TTA=true2020.11 | 51.5 | — | 57.1 | 34.2 | 53.4 | 64.1 | — | — | — | — | — | |
| YOLOX-xBackbone=Modified CSP v5, Size=6402022.03 | 51.5 | — | — | — | — | — | — | — | — | — | — | |
| PP-YOLOE-lBackbone=CSPRepResNet, Size=6402022.03 | 51.4 | 68.9 | 55.6 | 31.4 | 55.3 | 66.1 | — | — | 78.1 | 149.2 | — | |
| PAAIteration=180k, Backbone=ResNeXt-64x4d-101-DCN, multi-scale testing=true2021.03 | 51.3 | 68.8 | 56.6 | 34.3 | 53.5 | 63.6 | — | — | — | — | — | |
| TSDBackbone=SENet154 + DCN, TTA=true2020.10 | 51.2 | 71.9 | 56 | 33.8 | 54.8 | 64.2 | — | — | — | — | — | |
| YOLOX-XBackbone=Modified CSP v5, Size=640, FPS (V100)=57.82021.07 | 51.2 | 69.6 | 55.7 | 31.2 | 56.1 | 66.1 | — | — | — | — | — | |
| BoxeR-2DBackbone=R-101, Epochs=36, end-to-end=true, schedule=3x2021.11 | 51.1 | 68.5 | 55.8 | 31.5 | 54.1 | 64.6 | — | — | — | — | — | |
| BoxeR-2DEpoch=36, end-to-end=true, Backbone=R-101, Schedule=3×2021.11 | 51.1 | — | — | 31.5 | 54.1 | 64.6 | — | — | — | — | — | |
| PANet (Our Team 2017)year=2017, ensemble=true, testing_tricks=true2018.03 | 51 | 70.5 | 55.8 | 32.6 | 53.9 | 64.8 | — | — | — | — | — | |
| ATSSBackbone=ResNeXt-101 + DCN, TTA=true2020.10 | 50.7 | 68.9 | 56.3 | 33.2 | 52.9 | 62.4 | — | — | — | — | — | |
| ATSSIteration=180k, Backbone=ResNeXt-64x4d-101-DCN, multi-scale testing=true2021.03 | 50.7 | 68.9 | 56.3 | 33.2 | 52.9 | 62.2 | — | — | — | — | — | |
| ATSSBackbone=ResNeXt-101-DCN, TTA=true2020.11 | 50.7 | 68.9 | 56.3 | 33.2 | 52.9 | 62.4 | — | — | — | — | — | |
| YOLOv5-xBackbone=Modified CSP v6, Size=6402022.03 | 50.7 | 68.9 | — | — | — | — | — | — | — | — | — | |
| YOLOv5-XBackbone=Modified CSP v5, Size=640, FPS (V100)=62.52021.07 | 50.4 | 68.8 | — | — | — | — | — | — | — | — | — | |
| PP-YOLOv2Backbone=ResNet101-vd-dcn, Size=6402022.03 | 50.3 | 69 | 55.3 | 31.6 | 53.9 | 62.4 | — | — | 50.3 | 87 | — | |
| PP-YOLOv2Backbone=ResNet101-vd-dcn, Size=640, FPS (V100)=50.32021.07 | 50.3 | 69 | 55.3 | 31.6 | 53.9 | 62.4 | — | — | — | — | — | |
| Deformable DETRBackbone=ResNeXt-101 + DCN, TTA=false2020.10 | 50.1 | 69.7 | 54.6 | 30.6 | 52.8 | 64.7 | — | — | — | — | — | |
| Deformable DETRBackbone=ResNeXt-101, Backbone Pre-training=IN-1K, Testing Scale=single-scale, Framework=Closed-Set2022.12 | 50.1 | 69.7 | 54.6 | — | — | — | — | — | — | — | — | |
| YOLOX-lBackbone=Modified CSP v5, Size=6402022.03 | 50.1 | — | — | — | — | — | — | — | — | — | — | |
| BoxeR-2DBackbone=R-50, Epochs=50, end-to-end=true2021.11 | 50 | 67.9 | 54.7 | 30.9 | 52.8 | 62.6 | — | — | — | — | — | |
| YOLOX-LBackbone=Modified CSP v5, Size=640, FPS (V100)=692021.07 | 50 | 68.5 | 54.5 | 29.8 | 54.5 | 64.4 | — | — | — | — | — | |
| BoxeR-2DBackbone=R-50, Epochs=36, end-to-end=true, schedule=3x2021.11 | 49.9 | 68 | 54.4 | 30.9 | 52.6 | 62.5 | — | — | — | — | — | |
| DW*Backbone=ResNeXt-101-64x4d, Auxiliary Learning=true, Training Mode=multi-scale, Detection Head=TOOD head [9]2022.03 | 49.8 | 67.7 | 53.8 | 30.4 | 52.3 | 63 | — | — | — | — | — | |
| PP-YOLOE+-mBackbone=CSPRepResNet, Size=640, Pre-trained=Objects3652022.03 | 49.8 | 67.1 | 54.5 | 31.8 | 53.9 | 66.2 | — | — | 123.4 | 208.3 | — | |
| EfficientDet-D4Input Resolution=1024, Params=21M, FLOPs=55B, Latency (TitanV)=65ms, Latency (V100)=42.8ms2019.11 | 49.7 | 68.4 | 53.9 | — | — | — | — | — | — | — | — | |
| DW+box refineBackbone=ResNet-101-DCN, Auxiliary Learning=true, Training Mode=multi-scale2022.03 | 49.5 | 67.7 | 53.4 | 28.9 | 52.2 | 63.7 | — | — | — | — | — | |
| PP-YOLOv2Backbone=ResNet50-vd-dcn, Size=6402022.03 | 49.5 | 68.2 | 54.4 | 30.7 | 52.9 | 61.2 | — | — | 68.9 | 106.5 | — |