Object Detection on ScanNet v2 (test)
50AP@0.50GroupFree
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GroupFreeNetwork=EQ-PointNet++ (L6, O256)2022.03 | 50 | 68 | |
| GroupFreeNetwork=PointNet++ (L6, O256)2022.03 | 48.9 | 67.3 | |
| GroupFree+Network=PointNet++ (L6, O256), Implementation=MMDetection3D [8]2022.03 | 47.8 | 66.3 | |
| Point-SRAPre-training Dataset=ShapeNet2026.01 | 47.4 | — | |
| Point-BERT w/ LCMPretrain=MPM2024.05 | 47.3 | 65.3 | |
| Point-MAE w/ LCMPretrain=MPM2024.05 | 47.2 | 64.7 | |
| LCMPretrain=X2024.05 | 46.4 | 63.8 | |
| MaskPoint w/ LCMPretrain=MPM2024.05 | 46.3 | 65.3 | |
| ACT w/ LCMPretrain=MPM2024.05 | 45.8 | 65 | |
| VoteNetNetwork=EQ-PointNet++2022.03 | 45.4 | 64.3 | |
| Point-M2AE w/ LCMPretrain=MPM2024.05 | 44 | 63.5 | |
| PointDifPre-training Dataset=ShapeNet2026.01 | 43.7 | — | |
| DepthContrastPretrain=CL2024.05 | 42.9 | 64 | |
| DepthContrastPre-training Dataset=ScanNet-vid2026.01 | 42.9 | — | |
| Point-MAEPre-training Dataset=ShapeNet2026.01 | 42.8 | — | |
| PointGPT-LTuning Strategy=Baseline, Backbone=PointGPT-L, Trainable Parameters=317.72M2024.10 | 42.2 | 60.9 | |
| PointGSTTuning Strategy=PEFT, Backbone=PointGPT-L, Trainable Parameters=17.31M2024.10 | 42.2 | 61.2 | |
| ACTPretrain=MPM2024.05 | 42.1 | 63.8 | |
| MaskPointPretrain=MPM2024.05 | 42.1 | 64.2 | |
| MaskPointPre-training Dataset=ScanNet-Medium2026.01 | 42.1 | — | |
| IDPTTuning Strategy=PEFT, Backbone=PointGPT-L, Trainable Parameters=24.93M2024.10 | 41.7 | 60 | |
| Point-M2AEPretrain=MPM, reproduction=true2024.05 | 41.4 | 60 | |
| Point-MAEPretrain=MPM, reproduction=true2024.05 | 41.2 | 59.5 | |
| Point-PEFTTuning Strategy=PEFT, Backbone=PointGPT-L, Trainable Parameters=17.71M2024.10 | 41.1 | 60.2 | |
| TransformerPretrain=X2024.05 | 40.6 | 60.5 | |
| PointGSTTuning Strategy=PEFT, Backbone=ACT, Trainable Parameters=13.71M2024.10 | 40.3 | 60.3 | |
| DAPTTuning Strategy=PEFT, Backbone=PointGPT-L, Trainable Parameters=18.88M2024.10 | 40.3 | 60.7 | |
| RECONTuning Strategy=Baseline, Backbone=RECON, Trainable Parameters=34.63M2024.10 | 40 | 59.6 | |
| VoteNet+Network=PointNet++, Implementation=MMDetection3D [8]2022.03 | 39.9 | 62.9 | |
| Point-MAETuning Strategy=Baseline, Backbone=Point-MAE, Trainable Parameters=34.63M2024.10 | 39.8 | 59.3 | |
| ACTTuning Strategy=Baseline, Backbone=ACT, Trainable Parameters=34.63M2024.10 | 39.8 | 59.9 | |
| PointGSTTuning Strategy=PEFT, Backbone=RECON, Trainable Parameters=13.71M2024.10 | 39.7 | 59.5 | |
| PIMAEPretrain=MPM2024.05 | 39.4 | 62.6 | |
| PointGSTTuning Strategy=PEFT, Backbone=Point-MAE, Trainable Parameters=13.71M2024.10 | 39.2 | 59.9 | |
| Linear probingTuning Strategy=Linear probing, Backbone=PointGPT-L, Trainable Parameters=15.48M2024.10 | 39.1 | 59.9 | |
| Point-PEFTTuning Strategy=PEFT, Backbone=Point-MAE, Trainable Parameters=13.81M2024.10 | 38.9 | 58 | |
| DAPTTuning Strategy=PEFT, Backbone=RECON, Trainable Parameters=13.99M2024.10 | 38.7 | 59.7 | |
| PointGSTTuning Strategy=PEFT, Backbone=Point-BERT, Trainable Parameters=13.71M2024.10 | 38.6 | 58.4 | |
| DAPTTuning Strategy=PEFT, Backbone=Point-MAE, Trainable Parameters=13.99M2024.10 | 38.5 | 59.6 | |
| STRLPretrain=CL2024.05 | 38.4 | — | |
| STRLPre-training Dataset=ScanNet2026.01 | 38.4 | — | |
| Point-BERTTuning Strategy=Baseline, Backbone=Point-BERT, Trainable Parameters=34.63M2024.10 | 38.3 | 61 | |
| Point-BERTPretrain=MPM2024.05 | 38.3 | 61 | |
| Point-BERTPre-training Dataset=ScanNet-Medium2026.01 | 38.3 | — | |
| IDPTTuning Strategy=PEFT, Backbone=Point-MAE, Trainable Parameters=14.68M2024.10 | 38.2 | 58.9 | |
| Point-PEFTTuning Strategy=PEFT, Backbone=RECON, Trainable Parameters=13.81M2024.10 | 38.2 | 58.5 | |
| Linear probingTuning Strategy=Linear probing, Backbone=Point-MAE, Trainable Parameters=13.35M2024.10 | 38.1 | 58.9 | |
| PointContrastPretrain=CL2024.05 | 38 | 58.5 | |
| PointContrastPre-training Dataset=ScanNet2026.01 | 38 | — | |
| DAPTTuning Strategy=PEFT, Backbone=ACT, Trainable Parameters=13.99M2024.10 | 37.9 | 57.6 | |
| 3DETR (baseline)Pretrain=X2024.05 | 37.9 | 62.1 | |
| Linear probingTuning Strategy=Linear probing, Backbone=RECON, Trainable Parameters=13.35M2024.10 | 37.6 | 57.6 | |
| DAPTTuning Strategy=PEFT, Backbone=Point-BERT, Trainable Parameters=13.99M2024.10 | 37 | 58.3 | |
| IDPTTuning Strategy=PEFT, Backbone=Point-BERT, Trainable Parameters=14.68M2024.10 | 36.5 | 58.3 | |
| Point-PEFTTuning Strategy=PEFT, Backbone=Point-BERT, Trainable Parameters=13.81M2024.10 | 36.2 | 58.1 | |
| Linear probingTuning Strategy=Linear probing, Backbone=ACT, Trainable Parameters=13.35M2024.10 | 36.2 | 56.2 | |
| IDPTTuning Strategy=PEFT, Backbone=ACT, Trainable Parameters=14.68M2024.10 | 36.2 | 58.1 | |
| IDPTTuning Strategy=PEFT, Backbone=RECON, Trainable Parameters=14.68M2024.10 | 36.2 | 57.4 | |
| Point-PEFTTuning Strategy=PEFT, Backbone=ACT, Trainable Parameters=13.81M2024.10 | 36 | 57.5 | |
| Linear probingTuning Strategy=Linear probing, Backbone=Point-BERT, Trainable Parameters=13.35M2024.10 | 35.5 | 56.9 | |
| VoteNet2026.01 | 35.5 | — | |
| VoteNetNetwork=PointNet++2022.03 | 33.5 | 58.6 | |
| VoteNetPretrain=X2024.05 | 33.5 | 58.6 | |
| 3D-SISInput data modality=geometry + color, Number of RGB-D views=52018.12 | 22.5 | 40.2 | |
| 3D-SISInput data modality=geometry + color, Number of RGB-D views=32018.12 | 19 | 36.6 | |
| 3D-SISInput data modality=geometry + color, Number of RGB-D views=12018.12 | 18.7 | 35.1 | |
| 3D-SISInput data modality=geometry only2018.12 | 16 | 27.6 | |
| Frustum PointNetinput_source=RGB-D frame2018.12 | 10.8 | 19.8 | |
| Mask R-CNN 2D-3Dinput_source=RGB-D frame2018.12 | 10.5 | 17.3 | |
| Deep Sliding Shapesinput_source=RGB-D frame2018.12 | 6.8 | 15.2 |