Semantic Segmentation on ScanNet v2 (val)
80.7mIoUConcerto
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ConcertoLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 80.7 | 87.4 | 93.1 | |
| SonataYear=2024, Protocol=full fine-tuning2025.03 | 79.4 | — | — | |
| SonataLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 79.4 | 86.1 | 92.5 | |
| SonataYear=2024, Protocol=decoder probing2025.03 | 79.1 | — | — | |
| PTv3Training Strategy=multi-dataset joint training (PPT)2023.12 | 78.6 | — | — | |
| PTv3 + PPTYear=2024, Training Regime=pre-trained2023.12 | 78.6 | — | — | |
| PTv3 + PPTYear=2024, Training Status=Pre-trained, Backbone=PTv32023.08 | 78.6 | — | — | |
| PPT (sup.)Year=2023, variant=enhanced2025.03 | 78.6 | — | — | |
| MSCYear=2023, variant=enhanced2025.03 | 78.2 | — | — | |
| MSCLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 78.2 | 85.3 | 92.2 | |
| ODINInput Data Type=Sensor RGBD Point Cloud, Backbone=Swin-B2024.01 | 77.8 | — | — | |
| ODINYear=20242025.03 | 77.8 | — | — | |
| Pambacategory=Mamba2024.06 | 77.6 | — | — | |
| PTv3Learnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 77.6 | 85 | 92 | |
| PambaArchitecture=Mamba2026.05 | 77.6 | — | — | |
| SWIN3Dn-LPre-training strategy=pre-trained, Point Normals=true, Backbone scale=Large2023.04 | 77.5 | — | — | |
| PTv3Training Strategy=trained from scratch2023.12 | 77.5 | — | — | |
| Swin3DYear=2023, Training Regime=scratch2023.12 | 77.5 | — | — | |
| PTv3Year=2024, Training Regime=scratch2023.12 | 77.5 | — | — | |
| PTv3Year=2024, Training Status=Scratch2023.08 | 77.5 | — | — | |
| PTv3category=Transformer2024.06 | 77.5 | — | — | |
| Swin3DYear=20232025.03 | 77.5 | — | — | |
| PTv3Year=20232025.03 | 77.5 | — | — | |
| PTv3Architecture=Transformer2026.05 | 77.5 | — | — | |
| Supervised HUNetBackbone=HUNet, Evaluation Protocol=Supervised2025.04 | 77 | — | — | |
| RelFlexformer (w/ PTv3)Architecture=Performer, Backbone=PTv32026.05 | 76.9 | — | — | |
| SWIN3Dn-SPre-training strategy=pre-trained, Point Normals=true, Backbone scale=Small2023.04 | 76.8 | — | — | |
| Serialized Point Mambamodeling=unidirectional sequential2024.07 | 76.8 | — | — | |
| SWIN3D-LPre-training strategy=pre-trained, Backbone scale=Large2023.04 | 76.7 | — | — | |
| Swin3D + SupervisedYear=2023, Training Regime=pre-trained2023.12 | 76.7 | — | — | |
| Swin3D-LInput Data Type=Mesh Sampled Point Cloud2024.01 | 76.7 | — | — | |
| Swin3D + SupervisedYear=2023, Training Status=Pre-trained, Backbone=Swin3D2023.08 | 76.7 | — | — | |
| SupervisedYear=2023, parent_method=Swin3D2025.03 | 76.7 | — | — | |
| OneFormer3DYear=20242025.03 | 76.6 | — | — | |
| RelFlexformer (w/ PTv3) + PointRoPEArchitecture=Performer, Backbone=PTv3, Positional Encoding=PointRoPE2026.05 | 76.6 | — | — | |
| SWIN3Dn-S*Pre-training strategy=trained from scratch, Point Normals=true, Backbone scale=Small2023.04 | 76.4 | — | — | |
| Swin3DTraining Strategy=trained from scratch2023.12 | 76.4 | — | — | |
| MinkUNet + PPTYear=2024, Training Regime=pre-trained2023.12 | 76.4 | — | — | |
| VMVFInput Data Type=Rendered RGBD Point Cloud2024.01 | 76.4 | — | — | |
| MinkUNet + PPTYear=2024, Training Status=Pre-trained, Backbone=MinkUNet2023.08 | 76.4 | — | — | |
| Swim3Dcategory=Transformer2024.06 | 76.4 | — | — | |
| PPT (sup.)Year=2023, variant=baseline2025.03 | 76.4 | — | — | |
| Swin3DArchitecture=Transformer2026.05 | 76.4 | — | — | |
| DeLA + X-3DGFLOPS=14.8, #Params=8.02024.04 | 76.3 | — | — | |
| KPConvXparams=13.5M2024.05 | 76.3 | — | — | |
| KPConvXYear=20242025.03 | 76.3 | — | — | |
| SWIN3D-SPre-training strategy=pre-trained, Backbone scale=Small2023.04 | 76.1 | — | — | |
| OA-CNNsYear=2024, Training Regime=scratch2023.12 | 76.1 | — | — | |
| OA-CNNsYear=2024, Training Status=Scratch2023.08 | 76.1 | — | — | |
| ConDaFormerInput=point, Test-time augmentation (TTA)=true2023.12 | 76 | — | — | |
| SPG(PTv2)input=point, Params. (M)=3.9/11.32024.08 | 76 | — | — | |
| Serialized Point Mamba-tinymodeling=bidirectional sequential, variant=compact2024.07 | 75.94 | — | — | |
| DeLAGFLOPS=14.0, #Params=7.02024.04 | 75.9 | — | — | |
| DeLAParams=8.0M2023.08 | 75.9 | — | — | |
| MPECFine-tuned=true2025.04 | 75.8 | — | — | |
| OctFormerPre-training strategy=supervised2023.04 | 75.7 | — | — | |
| OctFormerNumber of parameters=44.0M2024.01 | 75.7 | — | — | |
| OctFormerTraining Strategy=trained from scratch2023.12 | 75.7 | — | — | |
| OctFormerYear=2023, Training Regime=scratch2023.12 | 75.7 | — | — | |
| MinkUNet + GCYear=2024, Training Regime=pre-trained2023.12 | 75.7 | — | — | |
| OctFormerparams=39.0M2024.05 | 75.7 | — | — | |
| OctFormerInput Data Type=Mesh Sampled Point Cloud2024.01 | 75.7 | — | — | |
| OctFormerYear=2023, Training Status=Scratch2023.08 | 75.7 | — | — | |
| MinkUNet + GCYear=2024, Training Status=Pre-trained, Backbone=MinkUNet2023.08 | 75.7 | — | — | |
| OctFormercategory=Transformer2024.06 | 75.7 | — | — | |
| GCFine-tuned=true2025.04 | 75.7 | — | — | |
| OctFormerParams=39M2023.08 | 75.7 | — | — | |
| OctFormerYear=20232025.03 | 75.7 | — | — | |
| MSCLearnable Parameters=39.2M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 75.7 | 83.4 | 91.3 | |
| OctFormerArchitecture=Transformer2026.05 | 75.7 | — | — | |
| SWIN3D-S*Pre-training strategy=trained from scratch, Backbone scale=Small2023.04 | 75.5 | — | — | |
| MaskContrastPre-training strategy=unsupervised pre-training2023.04 | 75.5 | — | — | |
| PTv2Input=point, Test-time augmentation (TTA)=true2023.12 | 75.5 | — | — | |
| MinkUNet + MSCYear=2023, Training Regime=pre-trained2023.12 | 75.5 | — | — | |
| Swin3DYear=2023, Training Status=Scratch2023.08 | 75.5 | — | — | |
| MinkUNet + MSCYear=2024, Training Status=Pre-trained, Backbone=MinkUNet2023.08 | 75.5 | — | — | |
| PTv2Params=11.3M2023.08 | 75.5 | — | — | |
| MSCYear=2023, variant=baseline2025.03 | 75.5 | — | — | |
| PTv2Input=point2022.10 | 75.4 | — | — | |
| PointTransformerV2# Params(M)=12.8, Input=point, Runtime(ms)=2662022.08 | 75.4 | — | — | |
| PointTransformerV2Pre-training strategy=supervised2023.04 | 75.4 | — | — | |
| PTv2#Params=11.3M, FLOPs=14.3G2023.10 | 75.4 | — | — | |
| PointHR#Params=7.1M, FLOPs=10.3G2023.10 | 75.4 | — | — | |
| PTv2Memory usage (GB)=21.502023.10 | 75.4 | — | — | |
| PointHR-LMemory usage (GB)=23.582023.10 | 75.4 | — | — | |
| Point Trans. v2Number of parameters=11.3M2024.01 | 75.4 | — | — | |
| PTv2Training Strategy=trained from scratch2023.12 | 75.4 | — | — | |
| PTv2Year=2022, Training Regime=scratch2023.12 | 75.4 | — | — | |
| PTV22024.04 | 75.4 | — | — | |
| PTv2params=11.3M2024.05 | 75.4 | — | — | |
| Point Transformer v22024.07 | 75.4 | — | — | |
| Point Transformer v2Input Data Type=Mesh Sampled Point Cloud2024.01 | 75.4 | — | — | |
| PTv2Year=2022, Training Status=Scratch2023.08 | 75.4 | — | — | |
| PTv2input=point, Params. (M)=3.9/11.32024.08 | 75.4 | — | — | |
| PTv2category=Transformer2024.06 | 75.4 | — | — | |
| PTv2Year=20222025.03 | 75.4 | — | — | |
| Point Transformer V2Param.=12.8, FLOPs=18.22026.03 | 75.4 | — | — | |
| PTv2Architecture=Transformer2026.05 | 75.4 | — | — | |
| EQ-Net2024.05 | 75.3 | — | — | |
| MSCFine-tuned=true2025.04 | 75.3 | — | — |