Object Detection on MS COCO 2015 (test-dev)
57.8AP @ IoU=0.50 (Overall)TDM
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TDMtrain=trainval*, ROINet=IRNv2 + TDM, ClsNet=IRNv2 + TDM2016.12 | 57.8 | — | 39.8 | 17.1 | 40.3 | 52.1 | 31.6 | 49.3 | 51.9 | 28.1 | 56.6 | 71.1 | 37.3 | |
| RPN+ (ResNet)Eval. Rate=<1 Hz2017.03 | 55.7 | — | — | 15.6 | 38.7 | 50.9 | — | — | — | — | — | — | 34.9 | |
| Faster+++train data=trainval2017.08 | 55.7 | 34.9 | — | 15.6 | 38.7 | 50.9 | — | — | — | — | — | — | — | |
| Faster R-CNN (Our implementation)train=trainval*, ROINet=IRNv2, ClsNet=IRNv22016.12 | 55.5 | — | 36.7 | 13.5 | 38.1 | 52 | 29.8 | 46.2 | 48.9 | 23.2 | 54.3 | 70.8 | 34.7 | |
| TDMtrain=trainval*, ROINet=ResNet101 + TDM, ClsNet=ResNet101 + TDM2016.12 | 55.3 | — | 38.1 | 16.6 | 38.4 | 47.9 | 30.4 | 47.8 | 50.3 | 27.8 | 54.9 | 67.6 | 35.2 | |
| CoupleNettrain data=trainval, Multi-scale training=true2017.08 | 54.8 | 34.4 | 37.2 | 13.4 | 38.1 | 50.8 | 30 | 45 | 46.4 | 20.7 | 53.1 | 68.5 | — | |
| CoupleNettrain data=trainval2017.08 | 53.5 | 33.1 | 35.4 | 11.6 | 36.3 | 50.1 | 29.3 | 43.8 | 45.2 | 18.7 | 51.4 | 67.9 | — | |
| DeNet-101 (wide)Eval. Rate=17 Hz2017.03 | 53.4 | — | 36.1 | 12.3 | 36.1 | 50.8 | 29.6 | 42.6 | 43.5 | 19.3 | 46.9 | 64.3 | 33.8 | |
| Faster R-CNN (Our implementation)train=trainval*, ROINet=ResNet101, ClsNet=ResNet1012016.12 | 52.8 | — | 33.3 | 13.6 | 35.4 | 44.5 | 28 | 43.6 | 45.8 | 22.7 | 51.2 | 64.1 | 31.5 | |
| R-FCNEval. Rate=9 Hz2017.03 | 51.9 | — | — | 10.8 | 32.8 | 45 | — | — | — | — | — | — | 29.9 | |
| R-FCNtrain data=trainval, Multi-scale training=true2017.08 | 51.9 | 29.9 | — | 10.8 | 32.8 | 45 | — | — | — | — | — | — | — | |
| R-FCNtrain data=trainval2017.08 | 51.5 | 29.2 | — | 10.3 | 32.4 | 43.3 | — | — | — | — | — | — | — | |
| DeNet-101 (skip)Eval. Rate=33 Hz2017.03 | 51.4 | — | 34.6 | 10.5 | 35.1 | 50.9 | 28.5 | 40.2 | 40.8 | 14.7 | 44.9 | 63.8 | 32.3 | |
| DeNet-101Eval. Rate=34 Hz2017.03 | 50.5 | — | 34.2 | 9.7 | 34.9 | 50.6 | 28.4 | 39.8 | 40.3 | 13.1 | 44.8 | 64.1 | 31.9 | |
| IONtrain=trainval, ROINet=VGG16++, ClsNet=VGG16++2016.12 | 49.2 | — | 27.8 | 8.9 | 29.5 | 41.5 | 25.5 | 37.4 | 38.3 | 14.6 | 42.5 | 57.4 | 27.5 | |
| DeNet-34 (wide)Eval. Rate=44 Hz2017.03 | 48.9 | — | 31.8 | 10.1 | 30.9 | 45.7 | 27.3 | 39.5 | 40.3 | 17 | 42.8 | 60.9 | 30 | |
| SSD512*train data=trainval35k2017.08 | 48.5 | 28.8 | 30.3 | 10.9 | 31.8 | 43.5 | 26.1 | 39.5 | 42 | 16.5 | 46.6 | 60.8 | — | |
| TDMtrain=trainval*, ROINet=VGG16 + TDM, ClsNet=VGG16 + TDM2016.12 | 48.1 | — | 30.4 | 14.2 | 31.8 | 36.9 | 26.2 | 42.2 | 44.2 | 23.7 | 48.3 | 59.3 | 28.6 | |
| DeNet-34 (skip)Eval. Rate=82 Hz2017.03 | 47.9 | — | 31.1 | 8.8 | 30.9 | 47 | 26.9 | 38 | 38.6 | 13.2 | 41.7 | 61.6 | 29.5 | |
| PC-DARTS with SSDInput Size=320×320, Backbone=PC-DARTS, FLOPs=1.2B2019.07 | 46.9 | — | 30 | 7.9 | 32 | 48.3 | — | — | — | — | — | — | 28.9 | |
| SSD512Training Data=trainval35k2016.12 | 46.5 | — | 27.8 | 9 | 28.9 | 41.9 | 24.8 | 37.5 | 39.8 | 14 | 43.5 | 59 | 26.8 | |
| SSD512Training Data=trainval35k, Input Resolution=512x5122015.12 | 46.5 | — | 27.8 | 9 | 28.9 | 41.9 | 24.8 | 37.5 | 39.8 | 14 | 43.5 | 59 | 26.8 | |
| SSD512Eval. Rate=23 Hz2017.03 | 46.5 | — | 27.8 | 9 | 28.9 | 41.9 | 24.8 | 37.5 | 39.8 | 14 | 43.5 | 59 | 26.8 | |
| SSD512Input Size=512×512, Backbone=VGG-16, FLOPs=99.5B2019.07 | 46.5 | — | 27.8 | 9 | 28.9 | 41.9 | — | — | — | — | — | — | 26.8 | |
| DeNet-34Eval. Rate=83 Hz2017.03 | 46.2 | — | 31.2 | 7.8 | 30.8 | 47.4 | 26.9 | 38 | 38.5 | 11.2 | 41.9 | 63 | 29.4 | |
| Faster R-CNN (Reproduced)train=trainval, ROINet=VGG16, ClsNet=VGG162016.12 | 46 | — | 23.7 | 8.2 | 26.4 | 36.9 | 24 | 34.8 | 35.5 | 13.4 | 39.2 | 54.3 | 24.5 | |
| OHEMBackbone=VGG16, Multi-scale=true, Training Set=trainval2016.04 | 45.9 | 25.5 | 26.1 | 7.4 | 27.7 | 40.3 | — | — | — | — | — | — | — | |
| Faster R-CNNTraining Data=trainval2016.12 | 45.3 | — | 23.5 | 7.7 | 26.4 | 37.1 | 23.8 | 34 | 34.6 | 12 | 38.5 | 54.4 | 24.2 | |
| FasterReference=[25], Training Data=trainval2015.12 | 45.3 | — | 23.5 | 7.7 | 26.4 | 37.1 | 23.8 | 34 | 34.6 | 12 | 38.5 | 54.4 | 24.2 | |
| IONtrain data=train+S2017.08 | 44.7 | 24.9 | 25.3 | 7 | 26.1 | 40.1 | 23.9 | 33.5 | 34.1 | 10.7 | 38.8 | 54.1 | — | |
| Faster R-CNN (Our implementation)train=trainval*, ROINet=VGG16, ClsNet=VGG162016.12 | 44.7 | — | 21.5 | 9.4 | 27.1 | 32 | 22.7 | 36.8 | 39.4 | 18.3 | 44 | 56.2 | 23.3 | |
| OHEMBackbone=VGG16, Multi-scale=true, Training Set=train2016.04 | 44.4 | 24.4 | 24.8 | 7.1 | 26.4 | 38.5 | — | — | — | — | — | — | — | |
| YOLOv2Training Data=trainval35k2016.12 | 44 | — | 19.2 | 5 | 22.4 | 35.5 | 20.7 | 31.6 | 33.3 | 9.8 | 36.5 | 54.4 | 21.6 | |
| YOLOV2Input Size=416×416, Backbone=Darknet-19, FLOPs=17.5B2019.07 | 44 | — | 19.2 | 5 | 22.4 | 35.5 | — | — | — | — | — | — | 21.6 | |
| SharpMasktrain=train, ROINet=ResNet50, ClsNet=VGG162016.12 | 43.4 | — | — | — | — | — | — | — | — | — | — | — | 25.2 | |
| IONTraining Data=train2016.12 | 43.2 | — | 23.6 | 6.4 | 24.1 | 38.3 | 23.2 | 32.7 | 33.5 | 10.1 | 37.7 | 53.6 | 23.6 | |
| IONReference=[24], Training Data=train2015.12 | 43.2 | — | 23.6 | 6.4 | 24.1 | 38.3 | 23.2 | 32.7 | 33.5 | 10.1 | 37.7 | 53.6 | 23.6 | |
| SSD300*train data=trainval35k2017.08 | 43.1 | 25.1 | 25.8 | 6.6 | 25.9 | 41.4 | 23.7 | 35.1 | 37.2 | 11.2 | 40.4 | 58.4 | — | |
| Faster R-CNN2016.04 | 42.7 | 21.9 | — | — | — | — | — | — | — | — | — | — | — | |
| Faster R-CNNTraining Data=trainval2016.12 | 42.7 | — | — | — | — | — | — | — | — | — | — | — | 21.9 | |
| FasterReference=[2], Training Data=trainval2015.12 | 42.7 | — | — | — | — | — | — | — | — | — | — | — | 21.9 | |
| RPN (VGG)Eval. Rate=7 Hz2017.03 | 42.7 | — | — | — | — | — | — | — | — | — | — | — | 21.9 | |
| OHEMBackbone=VGG16, Multi-scale=false, Training Set=train2016.04 | 42.5 | 22.6 | 22.2 | 5 | 23.7 | 37.9 | — | — | — | — | — | — | — | |
| SSD300Training Data=trainval35k2016.12 | 41.2 | — | 23.4 | 5.3 | 23.2 | 39.6 | 22.5 | 33.2 | 35.3 | 9.6 | 37.6 | 56.5 | 23.2 | |
| SSD300Training Data=trainval35k, Input Resolution=300x3002015.12 | 41.2 | — | 23.4 | 5.3 | 23.2 | 39.6 | 22.5 | 33.2 | 35.3 | 9.6 | 37.6 | 56.5 | 23.2 | |
| SSD300Eval. Rate=58 Hz2017.03 | 41.2 | — | 23.4 | 5.3 | 23.2 | 39.6 | 22.5 | 33.2 | 35.3 | 9.6 | 37.6 | 56.5 | 23.2 | |
| SSD300Input Size=300×300, Backbone=VGG-16, FLOPs=35.2B2019.07 | 41.2 | — | 23.4 | 5.3 | 23.2 | 39.6 | — | — | — | — | — | — | 23.2 | |
| Fast R-CNNTraining Data=train2016.12 | 39.9 | — | 19.4 | 4.1 | 20 | 35.8 | 21.3 | 29.5 | 30.1 | 7.3 | 32.1 | 52 | 20.5 | |
| FastReference=[24], Training Data=train2015.12 | 39.9 | — | 19.4 | 4.1 | 20 | 35.8 | 21.3 | 29.5 | 30.1 | 7.3 | 32.1 | 52 | 20.5 | |
| Fast R-CNN2016.04 | 39.3 | 19.3 | 19.9 | 3.5 | 18.8 | 34.6 | 21.4 | 29.5 | 29.8 | 7.7 | 32.2 | 50.2 | — | |
| PeleeInput Size=304×304, Backbone=PeleeNet, FLOPs=1.3B2019.07 | 38.3 | — | 22.9 | — | — | — | — | — | — | — | — | — | 22.4 | |
| Fast R-CNN (FRCN)Backbone=VGG16, Multi-scale=false, Training Set=train2016.04 | 35.9 | 19.7 | 19.9 | 3.5 | 18.8 | 34.6 | — | — | — | — | — | — | — | |
| Fast R-CNNTraining Data=train2016.12 | 35.9 | — | — | — | — | — | — | — | — | — | — | — | 19.7 | |
| FastReference=[6], Training Data=train2015.12 | 35.9 | — | — | — | — | — | — | — | — | — | — | — | 19.7 | |
| SSDLiteV1Input Size=320×320, Backbone=MobileNet V1, FLOPs=1.3B2019.07 | — | — | — | — | — | — | — | — | — | — | — | — | 22.2 | |
| SSDLiteV2Input Size=320×320, Backbone=MobileNet V2, FLOPs=0.8B2019.07 | — | — | — | — | — | — | — | — | — | — | — | — | 22.1 | |
| SSDLiteV3Input Size=320×320, Backbone=MnasNet-A1, FLOPs=0.8B2019.07 | — | — | — | 3.8 | 21.7 | 42 | — | — | — | — | — | — | 23 |