3D Semantic Segmentation on ScanNet v2 (val)
78.6mIoUHAS-KD
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| HAS-KDM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point Transformer V3M.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=true2026.06 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G2PMethod Type=GS-guided2026.01 | 78.4 | 85.2 | 92.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ODIN (Swin-B)Venue=CVPR’24, Method Type=2D–3D Fusion, External pre-training=true2026.01 | 77.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniPre3DVenue=CVPR’25, Method Type=2D–3D Fusion, Reproduced by authors=true, External pre-training=true2026.01 | 77.6 | 85 | 92.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Protocol=Fully-supervised2026.03 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point Transformer V3M.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=true2026.06 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BFANetVenue=CVPR’25, Method Type=Geometric, Reproduced by authors=true2026.01 | 77.3 | 84.1 | 92.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PonderV2Venue=TPAMI’25, Method Type=2D–3D Fusion, External pre-training=true2026.01 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PT v3Venue=CVPR’24, Method Type=Geometric, Reproduced by authors=true2026.01 | 77 | 84.3 | 92.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Virtual Multi-view Fusion2020.07 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMVFVenue=ECCV’20, Method Type=2D–3D Fusion, External pre-training=true2026.01 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMVFM.M.F. (Multi-Modal Fusion)=true, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OctFormerM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 75.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAM-Guided Masked Token Prediction (Ours)Pre-trained=Yes, Backbone=Plain Transformer2024.10 | 75.4 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point Transformer V2M.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sparse EQ-Net2022.03 | 75.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LRPNetInput=voxel2023.01 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SemAffiNetAdditional 2D image input=true, Voxel size=2cm2022.05 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| O-CNNM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stratified TransformerInput=point2022.03 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stratified TransformerInput=point2023.01 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OctFormerVenue=TOG’23, Method Type=Geometric, Reproduced by authors=true2026.01 | 74.3 | 82.6 | 90.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Stratified TransformerM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointContrastPre-trained=Yes2024.10 | 74.1 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Plain Transformer + Bridge3DPre-trained=Yes2024.10 | 73.9 | 80.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hou et al.Pre-trained=Yes2024.10 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix3DAdditional 2D image input=false2022.05 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix3DType=Fully-sup.2025.03 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix3DProtocol=Fully-supervised2026.03 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix3DM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LargeKernel3DInput=voxel2023.01 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LGroundType=Fully-sup.2025.03 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VMNetProtocol=Fully-supervised2026.03 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LargeKernel3DM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DepthContrastPre-trained=Yes2024.10 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sparse U-Netstatus=Baseline, implementation=re-implemented version of SparseConvNet2022.03 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointMetaBase-XXLParams. (M)=19.7, FLOPs (G)=11.0, Throughput (ins./sec.)=902022.11 | 72.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-3DScene + PointTransPre-training=MM-3DScene, Backbone=PointTrans2022.12 | 72.8 | 82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BPNetAdditional 2D image input=true, Voxel size=2cm2022.05 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 4DContrast + SR-UNetPre-training method=4DContrast, Backbone=SR-UNet2022.12 | 72.3 | 80.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkUNetVenue=CVPR’19, Method Type=Geometric, Reproduced by authors=true2026.01 | 72.3 | 80.2 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNet2020.07 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetInput=voxel2022.03 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNet2022.03 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetAdditional 2D image input=false2022.05 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetInput=voxel2023.01 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SemAffiNetAdditional 2D image input=true, Voxel size=5cm2022.05 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fast Point TransformerInput=voxel2023.01 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-3DScene (w/o LCSD) + PointTransPre-training=MM-3DScene (w/o LCSD), Backbone=PointTrans2022.12 | 72.1 | 81.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SR-UNetPre-trained=None2024.10 | 72.1 | 80.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fast Point TransformerM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FAConvAdditional 2D image input=true2022.05 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointMetaBase-XLParams. (M)=15.3, FLOPs (G)=9.2, Throughput (ins./sec.)=1042022.11 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointNeXt-XLParams. (M)=41.6, FLOPs (G)=84.8, Throughput (ins./sec.)=432022.11 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointNeXt-XLParams (M)=41.6, FLOPs (G)=84.8, Throughput (ins./sec.)=462022.06 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointContrast + SR-UNetPre-training method=PointContrast, Backbone=SR-UNet2022.12 | 71.3 | 79.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointMetaBase-LParams. (M)=2.7, FLOPs (G)=2.0, Throughput (ins./sec.)=1872022.11 | 71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepViewAggVenue=CVPR’22, Method Type=2D–3D Fusion2026.01 | 71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepViewAggM.M.F. (Multi-Modal Fusion)=true, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointContrast + PointTransPre-training=PointContrast, Backbone=PointTrans2022.12 | 70.9 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSC + SR-UNetPre-training method=CSC, Backbone=SR-UNet2022.12 | 70.7 | 78.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointTransformerInput=point2022.03 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BPNetAdditional 2D image input=true, Voxel size=5cm2022.05 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointTransformerInput=point2023.01 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point TransformerParams. (M)=7.8, FLOPs (G)=5.62022.11 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointTransPre-training=scratch, Backbone=PointTrans2022.12 | 70.6 | 79.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointMAE + PointTransPre-training=PointMAE, Backbone=PointTrans2022.12 | 70.6 | 79.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point TransformerParams (M)=7.8, FLOPs (G)=5.6, Throughput (ins./sec.)=342022.06 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINOv3 + SpatialBoostSpatialBoost=true2026.03 | 70.6 | — | 91.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point TransformerM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CBLParams (M)=18.62022.06 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RFCRAdditional 2D image input=false2022.05 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SR-UNetBackbone=SR-UNet2022.12 | 70 | 78.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BPNetVenue=CVPR’21, Method Type=2D–3D Fusion2026.01 | 69.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BPNetM.M.F. (Multi-Modal Fusion)=true, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 69.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointNeXt-LParams. (M)=7.1, FLOPs (G)=15.2, Throughput (ins./sec.)=1092022.11 | 69.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointNeXt-LParams (M)=7.1, FLOPs (G)=15.2, Throughput (ins./sec.)=1152022.06 | 69.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseConvNet2020.07 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseConvNetInput=voxel2022.03 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseConvNetAdditional 2D image input=false2022.05 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseConvNetInput=voxel2023.01 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseConvNetM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JointPoint Based2020.07 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConv2020.07 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JointPointBasedInput=point2022.03 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvInput=point2022.03 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConv2022.03 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvAdditional 2D image input=false2022.05 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JointPointBasedInput=point2023.01 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvInput=point2023.01 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvParams. (M)=15.02022.11 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvBackbone=KPConv2022.12 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SupConType=Fully-sup.2025.03 | 69.2 | 77.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetType=Fully-sup.2025.03 | 69.2 | 77.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvParams (M)=15, FLOPs (G)=302022.06 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KPConvM.M.F. (Multi-Modal Fusion)=false, M.D.F. (Multi-Dataset Fusion)=false2026.06 | 69.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |