Semantic Segmentation on S3DIS (Area 5)
79.6mIOUPCM-Tiny
Evaluation Results
| Method | Links | ||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PCM-TinyAdditional local feature extractor=DeLA blocks2024.03 | 79.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.8 | 95.1 | — | — | — | — | — | — | |
| UtoniaProtocol=fine-tuning, Learnable Parameters=157.7M, Parameter Percentage=100%2026.03 | 78.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 86.8 | 93.4 | — | — | — | — | — | — | |
| ConcertoLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 85 | 93.2 | — | — | — | — | — | — | |
| ConcertoLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 85 | 93.2 | — | — | — | — | — | — | |
| ConcertoProtocol=fine-tuning, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 85 | 93.2 | — | — | — | — | — | — | |
| DoReMiSource=-2025.11 | 77.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.5 | 93.1 | — | — | — | — | — | — | |
| UtoniaProtocol=decoder tuning, Learnable Parameters=20.5M, Parameter Percentage=13%2026.03 | 76.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | 82 | 92.4 | — | — | — | — | — | — | |
| SonataProtocol=Fine-Tuning, Additional Data=true2025.12 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | — | — | — | — | — | — | — | |
| SonataYear=2024, Evaluation Protocol=full fine-tuning, Pre-training=true2025.03 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | 93 | — | — | — | — | — | — | |
| SonataLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | 93 | — | — | — | — | — | — | |
| SonataProtocol=fine-tuning, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | 93 | — | — | — | — | — | — | |
| SonataSource=CVPR 20252025.11 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | 93 | — | — | — | — | — | — | |
| ConcertoProtocol=decoder tuning, Learnable Parameters=16.3M, Parameter Percentage=13%2026.03 | 75.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 84.2 | 92.3 | — | — | — | — | — | — | |
| DOSProtocol=Fine-Tuning, Additional Data=true2025.12 | 75.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.8 | — | — | — | — | — | — | — | |
| D-DITRProtocol=Fine-Tuning, Additional Data=false2025.12 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Year=2024, Training=Pre-trained, Pre-training Method=PPT [92]2023.12 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Training Strategy=multi-dataset joint training (PPT)2023.12 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv32024.03 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PPT (sup.)Year=2023, Pre-training=true2025.03 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PPTYear=2023, Pre-training=true2025.03 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UtoniaProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.2 | 91.5 | — | — | — | — | — | — | |
| PTv3reproduced=false2026.06 | 74.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SWIN3D-LPre-training strategy=pre-trained, Backbone scale=Large2023.04 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DYear=2023, Training=Pre-trained, Pre-training Method=Supervised [101]2023.12 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Supervised (Swin3D)Year=2023, Pre-training=true2025.03 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataYear=2024, Evaluation Protocol=decoder probing, Pre-training=true2025.03 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataProtocol=decoder tuning, Learnable Parameters=16.3M, Parameter Percentage=13%2026.03 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.4 | 92.6 | — | — | — | — | — | — | |
| DeLA + X-3DGFLOPS=14.8, #Params=8.02024.04 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | 92.2 | — | — | — | — | — | — | |
| DeLA+X-3D2024.03 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | 92.2 | — | — | — | — | — | — | |
| PPTProtocol=supervised, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | 92 | — | — | — | — | — | — | |
| PPTSource=CVPR 20242025.11 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | 92 | — | — | — | — | — | — | |
| DOSProtocol=Fine-Tuning, Additional Data=false2025.12 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | 83.6 | — | — | — | — | — | — | — | |
| DOSProtocol=Fine-tuning2026.03 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeLAGFLOPS=14.0, #Params=7.02024.04 | 74.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80 | 92.2 | — | — | — | — | — | — | |
| DeLA2024.03 | 74.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 80.1 | 92.2 | — | — | — | — | — | — | |
| PCM-Tiny2024.03 | 74.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.6 | 92.9 | — | — | — | — | — | — | |
| DeLAInput size=16x15000 points2023.08 | 74.1 | — | — | — | — | 55.1 | 61.4 | 76 | 93.2 | 84.4 | 79.4 | 85.7 | 80.8 | 65.2 | 80 | 92.2 | — | — | — | 468 | — | — | |
| MVNetBackbone=SR-UNet2025.12 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.5 | 91.7 | — | — | — | — | — | — | |
| PointINSProtocol=Fine-tuning2026.03 | 73.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConDaFormerInput=point, test-time-augmentation (TTA)=true2023.12 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 92.4 | — | — | — | — | — | — | |
| KPConvX-L2024.05 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.7 | 91.7 | — | — | — | — | — | — | |
| KPConvX-L2024.03 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.7 | 91.7 | — | — | — | — | — | — | |
| Pambacategory=Mamba2024.06 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConcertoProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.3 | 90.9 | — | — | — | — | — | — | |
| ConDAFParameters (M)=12.82026.03 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.6 | — | — | — | — | — | — | |
| PambaArchitecture=Mamba2026.05 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Year=2024, Training=Trained from scratch2023.12 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Training Strategy=trained from scratch2023.12 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3category=Transformer2024.06 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Protocol=Supervised, Additional Data=false2025.12 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | — | — | — | — | — | — | — | |
| PTv3Year=2023, Pre-training=false2025.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Learnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.7 | — | — | — | — | — | — | |
| PTv3Learnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.7 | — | — | — | — | — | — | |
| PTv3Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.7 | — | — | — | — | — | — | |
| Point Transformer V3Param. (M)=46.2, FLOPs (G)=5.22026.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.7 | — | — | — | — | — | — | |
| PTv3Evaluation protocol=supervised2026.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3 (sup.)Protocol=Supervised2026.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataProtocol=Fine-tuning2026.03 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Source=CVPR 20242025.11 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91.7 | — | — | — | — | — | — | |
| PTv3Architecture=Transformer2026.05 | 73.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPG(PTv2)input=point, Params. (M)=3.9/11.32024.08 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.5 | 91.9 | — | — | — | — | — | — | |
| PointHR2023.10 | 73.2 | 94 | 98.5 | 87.5 | 0 | 53.7 | 62.9 | 80.2 | 92.5 | 84.2 | 76.5 | 75.4 | 84.8 | 61.8 | 78.7 | 91.8 | — | — | — | — | — | — | |
| PonderV2Pre-training strategy=PonderV22023.10 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | 79 | 92.2 | — | — | — | — | — | — | |
| MSMProtocol=Fine-Tuning, Additional Data=false2025.12 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PT V3Parameters (M)=42.62026.03 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSP (Ours)Initialization=pre-trained2023.05 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SWIN3D-SPre-training strategy=pre-trained, Backbone scale=Small2023.04 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOSProtocol=Decoder2026.03 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointINSProtocol=Decoder2026.03 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkUNetYear=2024, Training=Pre-trained, Pre-training Method=PPT [92]2023.12 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv22024.03 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78 | 91.6 | — | — | — | — | — | — | |
| PPTPre-training strategy=PPT2023.10 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.2 | 90.8 | — | — | — | — | — | — | |
| PTv2Input size=16x15000 points2023.08 | 72.7 | — | — | — | — | 34.4 | 64.7 | 77.9 | 84.4 | 93.1 | 86.3 | 77.3 | 84.5 | 62.2 | 78 | 91.6 | — | — | — | 83 | — | — | |
| HPENetParam. (M)=46.3, FLOPs (G)=148.8, TP (ins./sec.)=572026.03 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.5 | 91.5 | — | — | — | — | — | — | |
| SAT2023.01 | 72.6 | 93.6 | 98.5 | 87.2 | 0 | 49.3 | 61.1 | 73.6 | 91.8 | 83.7 | 77.9 | 81.7 | 82.3 | 63.4 | 78.8 | — | — | — | — | — | — | — | |
| PointTransformer (PT) + ERDASupervision Setting=Fully2023.05 | 72.6 | 95.8 | 98.6 | 86.4 | 0 | 43.9 | 61.2 | 81.3 | 84.5 | 93 | 81.5 | 77.7 | 74.5 | 64.9 | — | — | — | — | — | — | — | — | |
| PTv2Input=point, test-time-augmentation (TTA)=true2023.12 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78 | 91.6 | — | — | — | — | — | — | |
| ConDaFormerInput=point, test-time-augmentation (TTA)=false2023.12 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.4 | 91.6 | — | — | — | — | — | — | |
| HPENet V2-XL*Param. (M)=16.1, FLOPs (G)=18.2, TP (ins./sec.)=1282026.03 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.8 | 91.6 | — | — | — | — | — | — | |
| PointINS*Evaluation protocol=linear probing2026.03 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SWIN3D-S*Pre-training strategy=trained from scratch, Backbone scale=Small2023.04 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DYear=2023, Training=Trained from scratch2023.12 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DTraining Strategy=trained from scratch2023.12 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swim3Dcategory=Transformer2024.06 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DYear=2023, Pre-training=false2025.03 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Swin3DArchitecture=Transformer2026.05 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneFormer3D2023.11 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HPENet (SIN)Param. (M)=46.3, FLOPs (G)=147.2, TP (ins./sec.)=502026.03 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.9 | 91 | — | — | — | — | — | — | |
| PointVector-XL2022.05 | 72.3 | 95.1 | 98.6 | 85.1 | 0 | 41.4 | 60.8 | 76.7 | 92.1 | 84.4 | 77.2 | 82 | 85.1 | 61.4 | 78.1 | 91 | — | — | — | — | — | — | |
| PointVector-XLGFLOPS=58.5, #Params=24.12024.04 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.1 | 91 | — | — | — | — | — | — | |
| PointVector2024.05 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.1 | 91 | — | — | — | — | — | — | |
| PointMetaBase2024.05 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 91.3 | — | — | — | — | — | — | |
| PTv3Additional local feature extractor=DeLA blocks2024.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.4 | 91.4 | — | — | — | — | — | — | |
| SonataProtocol=Linear Probing, Additional Data=true2025.12 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.2 | — | — | — | — | — | — | — | |
| SonataYear=2024, Evaluation Protocol=linear probing, Pre-training=true2025.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.2 | 90.9 | — | — | — | — | — | — | |
| PointVector-XLParam. (M)=24.1, FLOPs (G)=58.5, TP (ins./sec.)=902026.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.1 | 91 | — | — | — | — | — | — | |
| HPENet V2-XLParam. (M)=16.1, FLOPs (G)=18.2, TP (ins./sec.)=1282026.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.4 | 91.5 | — | — | — | — | — | — | |
| Sonata*Evaluation protocol=linear probing2026.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |