Object Detection on PASCAL VOC 2012 (test)
97.2mAPInternImage-H
Evaluation Results
| Method | Links | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| InternImage-HPre-training=Objects3652022.11 | 97.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ATLDETv22022.11 | 92.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet512+Backbone=VGG-16, Stage=one-stage, Multi-scale testing=true2017.11 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet320+Backbone=VGG-16, Stage=one-stage, Multi-scale testing=true2017.11 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet512Backbone=VGG-16, Stage=one-stage, Multi-scale testing=false2017.11 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNN +++training data=07++12+COCO, Backbone=ResNet-101, test time (sec/img)=3.36, iterative box regression=true, context=true, multi-scale testing=true2016.05 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet512+Backbone=VGG-162017.11 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet320+Backbone=VGG-162017.11 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet320Backbone=VGG-16, Stage=one-stage, Multi-scale testing=false2017.11 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FSSD-300SSD Variant / Backbone=FSSD-300 / VGG-16, Candidate Model Used?=Yes, Time Saved (hrs)=0.002026.05 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD512Backbone=VGG-16, Stage=one-stage, Multi-scale testing=false2017.11 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R-FCNBackbone=ResNet-101, Stage=two-stage, Multi-scale testing=false2017.11 | 82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R-FCNtraining data=07++12+COCO, Backbone=ResNet-101, test time (sec/img)=0.17, multi-scale training=true2016.05 | 82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LCSSD Variant / Backbone=SSD / VGG-16, Candidate Model Used?=No, Time Saved (hrs)=2.58, Annotation Simulation Time (hrs)=9.262026.05 | 81.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DFPRbackbone=ResNet1012018.09 | 81.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TripleNet512backbone=ResNet1012018.09 | 81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCSSD Variant / Backbone=SSD / VGG-16, Candidate Model Used?=No, Time Saved (hrs)=2.58, Annotation Simulation Time (hrs)=9.262026.05 | 80.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FF-SSD-300/512SSD Variant / Backbone=FF-SSD-300 / 512 / VGG-16, Candidate Model Used?=No2026.05 | 80.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Concat-SSD-300/512SSD Variant / Backbone=Concat-SSD-300 / 512 / VGG-16, Candidate Model Used?=No2026.05 | 80.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RON384++Backbone=VGG-16, Stage=one-stage, Multi-scale testing=false2017.11 | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoupleNetTrain=07++122017.08 | 80.4 | 89.1 | 86.7 | 81.6 | 71 | 64.4 | 83.7 | 83.7 | 94 | 62.2 | 84.6 | 65.6 | 92.7 | 89.1 | 87.3 | 87.7 | 64.3 | 84.1 | 72.5 | 88.4 | 75.3 | — | |
| CoupleNetBackbone=ResNet-101, Input size=~1000 × 600, #Boxes=300, FPS=8.22017.11 | 80.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DES512backbone=VGG162018.09 | 80.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet512Backbone=VGG-16, Input size=512 x 512, #Boxes=16320, FPS=24.12017.11 | 80.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OHEM++Backbone=VGG-16, Stage=two-stage, Multi-scale testing=false2017.11 | 80.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD512Training Data=07++12+COCO, Input Size=512x5122015.12 | 80 | 90.7 | 86.8 | 80.5 | 67.8 | 60.8 | 86.3 | 85.5 | 93.5 | 63.2 | 85.7 | 64.4 | 90.9 | 89 | 88.9 | 86.8 | 57.2 | 85.1 | 72.8 | 88.4 | 75.9 | — | |
| DSSD513Backbone=ResNet-101, Input size=513 x 513, #Boxes=43688, FPS=5.52017.11 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSSD513backbone=ResNet1012018.09 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet512backbone=ResNet1012018.09 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD513Backbone=ResNet-101, Input size=513 x 513, #Boxes=43688, FPS=6.82017.11 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD512backbone=VGG2018.09 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD300Backbone=VGG-16, Stage=one-stage, Multi-scale testing=false2017.11 | 79.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSOD300Backbone=DS/64-192-48-1, Stage=one-stage, Multi-scale testing=false2017.11 | 79.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BlitzNet512backbone=ResNet502018.09 | 79 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD512*Train=07++122017.08 | 78.5 | 90 | 85.3 | 77.7 | 64.3 | 58.5 | 85.1 | 84.3 | 92.6 | 61.3 | 83.4 | 65.1 | 89.9 | 88.5 | 88.2 | 85.5 | 54.4 | 82.4 | 70.7 | 87.1 | 75.6 | — | |
| SSD512*Backbone=VGG-16, Input size=512 x 512, #Boxes=24564, FPS=192017.11 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCLCSSD Variant / Backbone=SSD / VGG-16, Candidate Model Used?=No, Time Saved (hrs)=2.58, Annotation Simulation Time (hrs)=9.262026.05 | 78.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefineDet320Backbone=VGG-16, Input size=320 × 320, #Boxes=6375, FPS=40.32017.11 | 78.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R-FCNTrain=07++122017.08 | 77.6 | 86.9 | 83.4 | 81.5 | 63.8 | 62.4 | 81.6 | 81.1 | 93.1 | 58 | 83.8 | 60.8 | 92.7 | 86 | 84.6 | 84.4 | 59 | 80.8 | 68.6 | 86.1 | 72.9 | — | |
| R-FCNBackbone=ResNet-101, Input size=~1000 × 600, #Boxes=300, FPS=92017.11 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| R-FCNtraining data=07++12, Backbone=ResNet-101, test time (sec/img)=0.17, multi-scale training=true2016.05 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD300Training Data=07++12+COCO, Input Size=300x3002015.12 | 77.5 | 90.2 | 83.3 | 76.3 | 63 | 53.6 | 83.8 | 82.8 | 92 | 59.7 | 82.7 | 63.5 | 89.3 | 87.6 | 85.9 | 84.3 | 52.6 | 82.5 | 74.1 | 88.4 | 74.2 | — | |
| DES300backbone=VGG162018.09 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IONTrain=07+12+S2017.08 | 76.4 | 87.5 | 84.7 | 76.8 | 63.8 | 58.3 | 82.6 | 79 | 90.9 | 57.8 | 82 | 64.7 | 88.9 | 86.5 | 84.7 | 82.3 | 51.4 | 78.2 | 69.2 | 85.2 | 73.5 | — | |
| IONBackbone=VGG-16, Input size=~1000 × 600, #Boxes=4000, FPS=1.252017.11 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSOD300Backbone=DS/64-192-48-1, Input size=300 x 300, #Boxes=8732, FPS=17.42017.11 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSSD321Backbone=ResNet-101, Input size=321 x 321, #Boxes=17080, FPS=9.52017.11 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNC_box+training data=VOC 07++12, pre-trained model=VGG-162015.12 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNCbox+training data=VOC 07++12, backbone=VGG-162015.12 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RPN+VGG, shared# proposals=300, training data=COCO+07++12, backbone=VGG-162015.06 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNNTraining Data=07++12+COCO, Minimum dimension=6002015.12 | 75.9 | 87.4 | 83.6 | 76.8 | 62.9 | 59.6 | 81.9 | 82 | 91.3 | 54.9 | 82.6 | 59 | 89 | 85.5 | 84.7 | 84.1 | 52.2 | 78.9 | 65.5 | 85.4 | 70.2 | — | |
| BaselineTraining Data=COCO + 07++122017.07 | 75.9 | 87.4 | 83.6 | 76.8 | 62.9 | 59.6 | 81.9 | 82 | 91.3 | 54.9 | 82.6 | 59 | 89 | 85.5 | 84.7 | 84.1 | 52.2 | 78.9 | 65.5 | 85.4 | 70.2 | — | |
| Faster R-CNNBackbone=VGG-16, Stage=two-stage, Multi-scale testing=false2017.11 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD300*Train=07++122017.08 | 75.8 | 88.1 | 82.9 | 74.4 | 61.9 | 47.6 | 82.7 | 78.8 | 91.5 | 58.1 | 80 | 64.1 | 89.4 | 85.7 | 85.5 | 82.6 | 50.2 | 79.8 | 73.6 | 86.6 | 72.1 | — | |
| SSD300*Backbone=VGG-16, Input size=300 x 300, #Boxes=8732, FPS=462017.11 | 75.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD321Backbone=ResNet-101, Input size=321 x 321, #Boxes=17080, FPS=11.22017.11 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD300backbone=VGG2018.09 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RON384backbone=VGG162018.09 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD512data=07++122016.12 | 74.9 | 87.4 | 82.3 | 75.8 | 59 | 52.6 | 81.7 | 81.5 | 90 | 55.4 | 79 | 59.8 | 88.4 | 84.3 | 84.7 | 83.3 | 50.2 | 78 | 66.3 | 86.3 | 72 | — | |
| SSD512Training Data=07++12, Input Size=512x5122015.12 | 74.9 | 87.4 | 82.3 | 75.8 | 59 | 52.6 | 81.7 | 81.5 | 90 | 55.4 | 79 | 59.8 | 88.4 | 84.3 | 84.7 | 83.3 | 50.2 | 78 | 66.3 | 86.3 | 72 | — | |
| DDTTraining Data=DDT + 07++122017.07 | 74.4 | 86.5 | 81.9 | 76.2 | 63.4 | 55.4 | 80.8 | 80.1 | 89.7 | 51.6 | 78.6 | 56.2 | 88.8 | 84.8 | 85.5 | 82.6 | 50.6 | 78.1 | 64.1 | 85.6 | 68.1 | — | |
| PPALSSD Variant / Backbone=ISD-SSD / VGG-16, Candidate Model Used?=Yes, Time Saved (hrs)=0.002026.05 | 74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MR_CNN_MORE_DATAcomp4=outside data allowed2015.06 | 73.9 | 85.5 | 82.9 | 76.6 | — | 57.8 | 62.7 | 79.4 | 77.2 | 86.6 | 55 | 79.1 | 62.2 | 87 | 83.4 | 84.7 | 78.9 | 45.3 | 73.4 | 65.8 | 80.3 | — | |
| MR-CNNBackbone=VGG-16, Input size=~1000 × 600, #Boxes=250, FPS=0.032017.11 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNet-101Backbone=ResNet-101, Detection Method=Faster R-CNN, Training Data=07++122015.12 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ResNetdata=07++122016.12 | 73.8 | 86.5 | 81.6 | 77.2 | 58 | 51 | 78.6 | 76.6 | 93.2 | 48.6 | 80.4 | 59 | 92.1 | 85.3 | 84.8 | 80.7 | 48.1 | 77.3 | 66.5 | 84.7 | 65.6 | — | |
| FasterTrain=07++122017.08 | 73.8 | 86.5 | 81.6 | 77.2 | 58 | 51 | 78.6 | 76.6 | 93.2 | 48.6 | 80.4 | 59 | 92.1 | 85.3 | 84.8 | 80.7 | 48.1 | 77.3 | 66.5 | 84.7 | 65.6 | — | |
| Faster R-CNNBackbone=ResNet-101, Input size=~1000 × 600, #Boxes=300, FPS=2.42017.11 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNNtraining data=07++12, Backbone=ResNet-101, test time (sec/img)=0.422016.05 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNC_boxtraining data=VOC 12, pre-trained model=VGG-162015.12 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNCboxtraining data=VOC 12, backbone=VGG-162015.12 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| YOLOv2 544data=07++12, resolution=544x5442016.12 | 73.4 | 86.3 | 82 | 74.8 | 59.2 | 51.8 | 79.8 | 76.5 | 90.6 | 52.1 | 78.2 | 58.5 | 89.3 | 82.5 | 83.4 | 81.3 | 49.1 | 77.2 | 62.4 | 83.8 | 68.7 | — | |
| YOLOv2Backbone=Darknet-19, Input size=544 x 544, #Boxes=845, FPS=402017.11 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD-300SSD Variant / Backbone=SSD-300 / VGG-16, Candidate Model Used?=No2026.05 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RON384Backbone=VGG-16, Input size=384 x 384, #Boxes=30600, FPS=152017.11 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SSD300data=07++122016.12 | 72.4 | 85.6 | 80.1 | 70.5 | 57.6 | 46.2 | 79.4 | 76.1 | 89.2 | 53 | 77 | 60.8 | 87 | 83.1 | 82.3 | 79.4 | 45.9 | 75.9 | 69.5 | 81.9 | 67.5 | — | |
| SSD300Training Data=07++12, Input Size=300x3002015.12 | 72.4 | 85.6 | 80.1 | 70.5 | 57.6 | 46.2 | 79.4 | 76.1 | 89.2 | 53 | 77 | 60.8 | 87 | 83.1 | 82.3 | 79.4 | 45.9 | 75.9 | 69.5 | 81.9 | 67.5 | — | |
| OHEMBackbone=VGG-16, Input size=~1000 × 600, #Boxes=300, FPS=72017.11 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ensemble of OHEM and Ours2017.04 | 71.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperNet_VGGcomp4=outside data allowed2015.06 | 71.4 | 84.2 | 78.5 | 73.6 | — | 55.6 | 53.7 | 78.7 | 79.8 | 87.7 | 49.6 | 74.9 | 52.1 | 86 | 81.7 | 83.3 | 81.8 | 48.6 | 73.5 | 59.4 | 79.9 | — | |
| HyperNetTrain=07++122017.08 | 71.4 | 84.2 | 78.5 | 73.6 | 55.6 | 53.7 | 78.7 | 79.8 | 87.7 | 49.6 | 74.9 | 52.1 | 86 | 81.7 | 83.3 | 81.8 | 48.6 | 73.5 | 59.4 | 79.9 | 65.7 | — | |
| HyperNetBackbone=VGG-16, Input size=~1000 × 600, #Boxes=100, FPS=0.882017.11 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HyperNet_SPcomp4=outside data allowed2015.06 | 71.3 | 84.1 | 78.3 | 73.3 | — | 55.5 | 53.6 | 78.6 | 79.6 | 87.5 | 49.5 | 74.9 | 52.1 | 85.6 | 81.6 | 83.2 | 81.6 | 48.4 | 73.2 | 59.3 | 79.7 | — | |
| Ensemble of two OHEM models2017.04 | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNCtraining data=VOC 12, pre-trained model=VGG-162015.12 | 70.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MNCtraining data=VOC 12, backbone=VGG-162015.12 | 70.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fast R-CNN + YOLOcomp4=outside data allowed, Ensemble=Fast R-CNN combined with YOLO2015.06 | 70.7 | 83.4 | 78.5 | 73.5 | — | 55.8 | 43.4 | 79.1 | 73.1 | 89.4 | 49.4 | 75.5 | 57 | 87.5 | 80.9 | 81 | 74.7 | 41.8 | 71.5 | 68.5 | 82.1 | — | |
| MR_CNN_S_CNNcomp4=outside data allowed2015.06 | 70.7 | 85 | 79.6 | 71.5 | — | 55.3 | 57.7 | 76 | 73.9 | 84.6 | 50.5 | 74.3 | 61.7 | 85.5 | 79.9 | 81.7 | 76.4 | 41 | 69 | 61.2 | 77.7 | — | |
| Faster R-CNNtraining data=VOC 07++12, pre-trained model=VGG-162015.12 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNNtraining data=VOC 07++12, backbone=VGG-162015.12 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VGG-16Backbone=VGG-16, Detection Method=Faster R-CNN, Training Data=07++122015.12 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RPN+VGG, shared# proposals=300, training data=07++12, backbone=VGG-162015.06 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNNcomp4=outside data allowed2015.06 | 70.4 | 84.9 | 79.8 | 74.3 | — | 53.9 | 49.8 | 77.5 | 75.9 | 88.5 | 45.6 | 77.1 | 55.3 | 86.9 | 81.7 | 80.9 | 79.6 | 40.1 | 72.6 | 60.9 | 81.2 | — | |
| Faster R-CNNdata=07++122016.12 | 70.4 | 84.9 | 79.8 | 74.3 | 53.9 | 49.8 | 77.5 | 75.9 | 88.5 | 45.6 | 77.1 | 55.3 | 86.9 | 81.7 | 80.9 | 79.6 | 40.1 | 72.6 | 60.9 | 81.2 | 61.5 | — | |
| Faster R-CNNTraining Data=07++12, Minimum dimension=6002015.12 | 70.4 | 84.9 | 79.8 | 74.3 | 53.9 | 49.8 | 77.5 | 75.9 | 88.5 | 45.6 | 77.1 | 55.3 | 86.9 | 81.7 | 80.9 | 79.6 | 40.1 | 72.6 | 60.9 | 81.2 | 61.5 | — | |
| BaselineTraining Data=07++122017.07 | 70.4 | 84.9 | 79.8 | 74.3 | 53.9 | 49.8 | 77.5 | 75.9 | 88.5 | 45.6 | 77.1 | 55.3 | 86.9 | 81.7 | 80.9 | 79.6 | 40.1 | 72.6 | 60.9 | 81.2 | 61.5 | — | |
| Faster R-CNNBackbone=VGG-16, Input size=~1000 × 600, #Boxes=300, FPS=72017.11 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ensemble of two of our models2017.04 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DEEP_ENS_COCOcomp4=outside data allowed2015.06 | 70.1 | 84 | 79.4 | 71.6 | — | 51.9 | 51.1 | 74.1 | 72.1 | 88.6 | 48.3 | 73.4 | 57.8 | 86.1 | 80 | 80.7 | 70.4 | 46.6 | 69.6 | 68.8 | 75.9 | — | |
| OHEM2017.04 | 69.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |