3D Semantic Segmentation on ScanNet20 (val)
79.1mIoUPTv3 + PPT (Ours)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PTv3 + PPT (Ours)Backbone=PTv3, Training Data=ScanNet + ScanNet200 + ScanNet++ + Structure3D + ARKit LabelMaker2024.10 | 79.1 | — | |
| PTv3 + fine-tune (Ours)Backbone=PTv3, Training Data=ARKit LabelMakerSN200 → ScanNet2024.10 | 78.9 | — | |
| PTv3 + PPTBackbone=PTv3, Training Data=ScanNet + S3DIS + Structure3D2024.10 | 78.6 | — | |
| PTv3 + fine-tune (Ours)Backbone=PTv3, Training Data=ARKit LabelMaker → ScanNet2024.10 | 78 | — | |
| PTv3 (vanilla)Backbone=PTv3, Training Data=ScanNet2024.10 | 77.5 | — | |
| MinkUNet + fine-tune (Ours)Backbone=MinkowskiNet, Training Data=ARKit LabelMakerSN200 → ScanNet2024.10 | 74.1 | — | |
| MinkUNet + Mix3DBackbone=MinkowskiNet, Training Data=ScanNet2024.10 | 73.6 | — | |
| MinkUNet + PonderV2Backbone=MinkowskiNet, Training Data=ScanNet (self-supervised) → ScanNet2024.10 | 73.5 | — | |
| MinkUNet (vanilla)Backbone=MinkowskiNet, Training Data=ScanNet2024.10 | 72.4 | — | |
| PTv3Regime=Supervised reference, Setting=Closed-set, supervised, Input=Depth-only geometry2026.07 | 65.4 | 74.2 | |
| Mosaic3D + UTTORegime=Non-private reference, Setting=Open-voc., training-free, Input=RGB-D2026.07 | 50.7 | 73.1 | |
| OpenScene3D + UTTORegime=Ours, Setting=Open-voc., training-free, Input=Depth-only geometry2026.07 | 47.3 | 66.8 | |
| Mosaic3D-DepthOnly + UTTORegime=Ours, Setting=Open-voc., training-free, Input=Depth-only geometry2026.07 | 36.8 | 57.8 |