Object Detection on NYUD v2 (test)
72.3Mean AP (b)Deep Sliding Shapes
Evaluation Results
| Method | Links | |||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Deep Sliding Shapesinput=RGB-D, variant=ours [depth + img]2015.11 | 72.3 | — | 84.7 | — | — | 61.1 | — | — | — | — | — | — | — | — | — | — | 70.5 | 55.4 | — | — | — | — | — | — | — | |
| Deep Sliding Shapesinput=depth, variant=ours [depth only]2015.11 | 67.8 | — | 83 | — | — | 58.8 | — | — | — | — | — | — | — | — | — | — | 68.6 | 49.5 | — | — | — | — | — | — | — | |
| [9] on estimated modelinput=RGB-D2015.11 | 58.5 | — | 73.4 | — | — | 44.2 | — | — | — | — | — | — | — | — | — | — | 57.2 | 33.4 | — | — | — | — | — | — | — | |
| 3D ShapeNetsInput Modality=Depth, fine-tuned=true2014.06 | 57.9 | 85.7 | 70.3 | — | — | 91.9 | — | 30 | — | 50 | — | — | 50 | 62.5 | — | — | 73.5 | 24.7 | — | 40 | — | — | — | — | — | |
| [9] on estimated modelinput=depth2015.11 | 57.6 | — | 72.7 | — | — | 47.5 | — | — | — | — | — | — | — | — | — | — | 54.6 | 40.6 | — | — | — | — | — | — | — | |
| [9] on instance seginput=RGB-D2015.11 | 48.4 | — | 74.7 | — | — | 18.6 | — | — | — | — | — | — | — | — | — | — | 50.3 | 28.6 | — | — | — | — | — | — | — | |
| ICPInput Modality=Depth2014.06 | 47.1 | 57.1 | 60.8 | — | — | 19.4 | — | 37.5 | — | 73.3 | — | — | 38.9 | 43.8 | — | — | 34.9 | 5.2 | — | 100 | — | — | — | — | — | |
| [9] on instance seginput=depth2015.11 | 46.5 | — | 71 | — | — | 18.2 | — | — | — | — | — | — | — | — | — | — | 49.6 | 30.4 | — | — | — | — | — | — | — | |
| [29] RGBDInput Modality=RGBD2014.06 | 44.8 | 0 | 74.3 | — | — | 69.3 | — | 17.5 | — | 46.6 | — | — | 38.8 | 46.8 | — | — | 60.2 | 44.1 | — | 50 | — | — | — | — | — | |
| 3D ShapeNetsInput Modality=Depth, fine-tuned=false2014.06 | 43.7 | 14.2 | 50 | — | — | 68.5 | — | 10 | — | 36.6 | — | — | 50 | 71.9 | — | — | 27.7 | 37.7 | — | 70 | — | — | — | — | — | |
| Sliding Shapesinput=depth2015.11 | 39.6 | — | 33.5 | — | — | 29 | — | — | — | — | — | — | — | — | — | — | 34.5 | 33.8 | — | — | — | — | — | — | — | |
| [29] DepthInput Modality=Depth2014.06 | 37.6 | 0 | 72.9 | — | — | 80.6 | — | 10 | — | 46.6 | — | — | 22.2 | 34.3 | — | — | 48.1 | 41.5 | — | 20 | — | — | — | — | — | |
| NNInput Modality=Depth2014.06 | 37.4 | 42.9 | 44.6 | — | — | 39.5 | — | 17.6 | — | 46.7 | — | — | 33.3 | 18.8 | — | — | 45.8 | 45.5 | — | 40 | — | — | — | — | — | |
| R-CNN (HHA)Modality=RGB-D, Encoding=HHA (geocentric embedding)2014.07 | 37.3 | 44.4 | 71 | 32.9 | 1.4 | 43.3 | 44 | 15.1 | 24.5 | 30.4 | 39.4 | 36.5 | 52.6 | 40 | 34.8 | 36.1 | 53.9 | 24.4 | 37.5 | 46.8 | — | — | — | — | — | |
| [29] RGBInput Modality=RGB2014.06 | 33.4 | 14.2 | 74.3 | — | — | 76.6 | — | 15 | — | 26.6 | — | — | 16.6 | 21.8 | — | — | 31.3 | 37.6 | — | 20 | — | — | — | — | — | |
| Mask3DPre-training Method=Mask3D (Ours)2023.02 | 25.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 44 | 28.3 | |
| RGBD-DPMModality=RGB-D2014.07 | 23.9 | 19.3 | 56 | 17.5 | 0.6 | 23.5 | 24 | 6.2 | 9.5 | 16.4 | 26.7 | 26.7 | 34.9 | 32.6 | 20.7 | 22.8 | 34.2 | 17.2 | 19.5 | 45.1 | — | — | — | — | — | |
| MAE-unsupIN→SNPre-training Method=MAE unsupervised ImageNet to ScanNet2023.02 | 23.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 40.3 | 24.5 | |
| RGB R-CNNModality=RGB2014.07 | 22.5 | 16.9 | 45.3 | 28.5 | 0.7 | 25.9 | 30.4 | 9.7 | 16.3 | 18.9 | 15.7 | 27.9 | 32.5 | 17 | 11.1 | 16.6 | 29.4 | 12.7 | 27.4 | 44.1 | — | — | — | — | — | |
| Pri3DPre-training Method=Pri3D2023.02 | 18.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 33 | 19.8 | |
| MoCoV2-supIN→SNPre-training Method=MoCoV2 ImageNet to ScanNet2023.02 | 17.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 30.1 | 18.1 | |
| ImageNet Pretrain (supIN)Pre-training Method=ImageNet Supervised2023.02 | 16.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 29.9 | 17.3 | |
| ScratchPre-training Method=None (Scratch)2023.02 | 9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 21.3 | 10.3 | |
| RGB DPMModality=RGB2014.07 | 9 | 0.9 | 27.6 | 9 | 0.1 | 7.8 | 7.3 | 0.7 | 2.5 | 1.4 | 6.6 | 22.2 | 10 | 9.2 | 4.3 | 5.9 | 9.4 | 5.5 | 5.8 | 34.4 | — | — | — | — | — | |
| GaussianPre-training Data=None, Supervised Pre-training=false2016.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 28.1 | — | — | — | |
| Gupta et al. [17]Pre-training Data=1M ImageNet [37], Supervised Pre-training=true2016.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 27.8 | 34.2 | 44.4 | — | — | |
| Gupta et al. [18]Pre-training Data=1M ImageNet [37], Supervised Pre-training=true2016.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 27.8 | 41.7 | 47.1 | — | — | |
| Krähenbühl et al. [25]Pre-training Data=20 NYU-D [39], Supervised Pre-training=false2016.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 12.5 | 32.2 | 34.5 | — | — | |
| Split-Brain AutoencoderPre-training Data=10k NYU-D [39], Supervised Pre-training=false2016.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 18.9 | 33.2 | 38.1 | — | — |