Semantic Segmentation on SemanticKITTI (val)
74.2mIoUAF2S3Net
Evaluation Results
| Method | Links | ||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AF2S3NetTraining Protocol=Trained from scratch2023.12 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOSProtocol=Fine-Tuning, Additional Data=true2025.12 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.3 | — | — | |
| RangeFormerVFM=false2025.09 | 73.3 | 96.7 | 69.4 | 73.7 | 59.9 | 66.2 | 78.1 | 75.9 | 58.1 | 92.4 | 73 | 78.8 | 42.4 | 92.3 | 70.1 | 86.6 | 73.3 | 72.8 | 66.4 | 66.6 | — | — | — | — | |
| DOSProtocol=Fine-Tuning, Additional Data=false2025.12 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81 | — | — | |
| DOSBackbone=Point Transformer v3, Evaluation Protocol=fine-tuning2026.03 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointINSBackbone=Point Transformer v3, Evaluation Protocol=fine-tuning2026.03 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataModality=3D-only2025.03 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataProtocol=Fine-Tuning, Additional Data=true2025.12 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.9 | — | — | |
| SonataEvaluation Protocol=full fine-tuning2025.03 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.9 | 93.4 | — | |
| SonataLearn.=124.8M, Pct.=100%, Evaluation Protocol=f.t.2026.03 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.9 | 93.2 | — | |
| Volt-B#Params=94.3M, Joint training=true2026.04 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Training Protocol=Multi-dataset joint training (PPT [92])2023.12 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3 + PPTYear=20242023.08 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PPT + PTv3Params.=46.3M, Training Protocol=supervised pre-training (fine-tuned)2023.08 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PPTSupervision=supervised2025.03 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.5 | 93.4 | — | |
| PTv3/PPT#Params=46.3M, Joint training=true2026.04 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3+PPTModality=LiDAR-only2026.05 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Volt-S#Params=23.7M, Joint training=true2026.04 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3 + M3NetYear=20242023.08 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UtoniaLearn.=157.7M, Pct.=100%, Evaluation Protocol=f.t.2026.03 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.8 | 93.5 | — | |
| UniD-shiftModality=LiDAR-Camera fusion2026.05 | 71.8 | 96.8 | 59.4 | 89.2 | 92.3 | 80.1 | 82.4 | 93.6 | 13.1 | 94.7 | 61.5 | 78.3 | 14.2 | 93.3 | 60.2 | 83.2 | 71.7 | 76 | 66.1 | 57.8 | — | — | — | — | |
| NOMAEBackbone=Point Transformer v3, Evaluation Protocol=fine-tuning2026.03 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSFNet (large)Modality=LiDAR-Camera fusion2026.05 | 71.5 | 97.6 | 61.5 | 88.5 | 96.5 | 82.8 | 82.4 | 93.6 | 2.2 | 94.8 | 52.1 | 83 | 0 | 93.4 | 73.7 | 89.1 | 72.8 | 75.6 | 66.3 | 52.3 | — | — | — | — | |
| MinkUNet + PPTYear=20242023.08 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PPT + SparseUNetParams.=41.0M, Training Protocol=supervised pre-training (fine-tuned)2023.08 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniSegModality=LiDAR-Camera fusion2026.05 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConcertoLearn.=157.7M, Pct.=100%, Evaluation Protocol=f.t.2026.03 | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77 | 92.5 | — | |
| PPT + SparseUNetParams.=41.0M, Training Protocol=supervised joint training2023.08 | 70.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Training Protocol=Trained from scratch2023.12 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Year=20242023.08 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Params.=46.2M2023.08 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Modality=3D-only2025.03 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Learn.=124.8M, Pct.=100%2026.03 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.1 | 92.6 | — | |
| PTv3Modality=LiDAR-only2026.05 | 70.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OA-CNNsYear=20242023.08 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OA-CNNs2026.03 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Volt-S#Params=23.7M, Joint training=false2026.04 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HEDNet2023.10 | 70.3 | 97.3 | 57.2 | 82.3 | 88.1 | — | 80.4 | 91.3 | 23.2 | 95.1 | 51.5 | 83.1 | 2.8 | 92.1 | 69.6 | 87.6 | 69.4 | 72.3 | 66.6 | 52.1 | 73.9 | — | — | — | |
| PTv2Training Protocol=Trained from scratch2023.12 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv2Year=20222023.08 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv2Modality=3D-only2025.03 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point Transformer V22026.03 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv2#Params=12.8M, Joint training=false2026.04 | 70.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LSK3DNet#Params=28.8M, Joint training=false2026.04 | 70.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UtoniaLearn.=20.5M, Pct.=13%, Evaluation Protocol=dec.2026.03 | 70 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 75.9 | 92.7 | — | |
| 2DPASSModality=LiDAR-Camera fusion2026.05 | 70 | 97.2 | 55.3 | 78.3 | 90.9 | 70.7 | 80.7 | 93.5 | 0.1 | 94.3 | 53.8 | 82 | 12.1 | 93 | 71.8 | 89.1 | 72.3 | 75.7 | 66 | 54.2 | — | — | — | — | |
| D-DITRProtocol=Fine-Tuning, Additional Data=false2025.12 | 69.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataBackbone=Point Transformer v3, Evaluation Protocol=fine-tuning2026.03 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| U2MKDModality=LiDAR-Camera fusion2026.05 | 69.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CurveCloudNetType=Curve2023.03 | 69.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CurveCloudNetType=Curve, Time (ms)=155, GPU (GB)=2.75, Param (M)=28.82023.03 | 69.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2DPASSTraining Protocol=Trained from scratch2023.12 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2DPASSYear=20222023.08 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 2DPASSModality=2D-3D fusion2025.03 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConcertoLearn.=20.5M, Pct.=13%, Evaluation Protocol=dec.2026.03 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.2 | 92.3 | — | |
| HPENet V2-XLParam.=16.1, FLOPs=18.12026.03 | 69.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3Protocol=Supervised, Additional Data=false2025.12 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.1 | — | — | |
| PTv3Supervision=supervised2025.03 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.1 | 92.6 | — | |
| PTv3Evaluation protocol=supervised2026.03 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3 (sup.)Backbone=Point Transformer v3, Evaluation Protocol=Supervised2026.03 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PTv3#Params=46.1M, Joint training=false2026.04 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerType=Voxel2023.03 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerType=Voxel, Time (ms)=144, GPU (GB)=3.46, Param (M)=32.32023.03 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DITRModality=2D-3D fusion2025.03 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MSeg3DModality=LiDAR-Camera fusion2026.05 | 69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cylinder3DType=Voxel, Time (ms)=233, GPU (GB)=1.62, Param (M)=55.92023.03 | 68.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOSBackbone=Point Transformer v3, Evaluation Protocol=decoder tuning2026.03 | 68.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SonataEvaluation Protocol=decoder probing2025.03 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.5 | 92.3 | — | |
| SonataLearn.=16.3M, Pct.=13%, Evaluation Protocol=dec.2026.03 | 68.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.5 | 92.3 | — | |
| MinkUNet342023.10 | 68.3 | 96.8 | 55 | 81.4 | 83.2 | — | 79.5 | 89.8 | 7.8 | 94.8 | 54.6 | 82.8 | 1.5 | 92 | 68.3 | 87.9 | 69.4 | 72.8 | 66.1 | 52.4 | 70.2 | — | — | — | |
| PTv3Modality=3D-only, Evaluation setup=reproduced2025.03 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOSProtocol=Linear Probing, Additional Data=true2025.12 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.4 | — | — | |
| DOS*Evaluation protocol=linear probing2026.03 | 68.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointINSBackbone=Point Transformer v3, Evaluation Protocol=decoder tuning2026.03 | 68.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WaffleIronYear=20232023.08 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WaffleIron2026.03 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointINS*Evaluation protocol=linear probing2026.03 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VaViT-B*test-time augmentation=false, epoch=best epoch, stochastic depth drop probability=0.5, token pillar resolution=0.5 m2026.05 | 68 | 96.3 | 53.2 | 76.3 | 95.2 | 62.1 | 80.1 | 94 | 0 | 95.8 | 51.9 | 83.9 | 0.2 | 90.7 | 62.9 | 87.9 | 71.9 | 72.9 | 65.7 | 50.7 | — | — | — | — | |
| WI-256test-time augmentation=false2026.05 | 68 | 96.1 | 58.1 | 79.7 | 77.4 | 59 | 81.1 | 92.2 | 1.3 | 95.5 | 50.2 | 83.6 | 6 | 92.1 | 67.5 | 87.8 | 73.8 | 73 | 65.7 | 52.2 | — | — | — | — | |
| SphereFormerTraining Protocol=Trained from scratch2023.12 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerType=v, Params.=32.3M, Training strategy=Expert2024.03 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerYear=20232023.08 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerParams.=32.3M2023.08 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerModality=3D-only2025.03 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormerParam.=32.3, FLOPs=89.82026.03 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormer#Params=32.3M, Joint training=false2026.04 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SphereFormertest-time augmentation=false2026.05 | 67.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UtoniaLearn.=<0.2M, Pct.=<0.2%, Evaluation Protocol=lin.2026.03 | 67.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.9 | 91.9 | — | |
| RangeFormerYear=20232023.08 | 67.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RangeFormerParam.=24.32026.03 | 67.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VaViT-Btest-time augmentation=false, epoch=final training epoch, stochastic depth drop probability=0.5, token pillar resolution=0.5 m2026.05 | 67.6 | 95.7 | 56.5 | 74.9 | 95.4 | 52.1 | 81.4 | 94.5 | 0.1 | 95.6 | 51.1 | 83.8 | 0.1 | 90.6 | 61 | 88.1 | 72 | 73.5 | 65.9 | 51.6 | — | — | — | — | |
| LCPSModality=2D-3D fusion2025.03 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DOSProtocol=Linear Probing, Additional Data=false2025.12 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.1 | — | — | |
| DOSBackbone=Point Transformer v3, Evaluation Protocol=linear probing2026.03 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HPENet V2-LParam.=3.3, FLOPs=4.92026.03 | 67.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointConvFormer#MACS (G)=91.1, # Params (M)=8.1, Input=Point2022.08 | 67.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HPENet V2-BParam.=2.2, FLOPs=4.52026.03 | 67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HPENet V2-SParam.=0.8, FLOPs=2.92026.03 | 66.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointINSBackbone=Point Transformer v3, Evaluation Protocol=linear probing2026.03 | 66.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinkowskiNetType=Voxel2023.03 | 66.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |