Semantic Segmentation on ScanNet200 (test)
41.6mIoUVolt-B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Volt-B#Params=94.3M, Training Setup=Jointly trained on multiple datasets2026.04 | 41.6 | — | — | — | — | |
| PTv3/PPT#Params=124.8M, Training Setup=Jointly trained on multiple datasets2026.04 | 41.4 | — | — | — | — | |
| PTv3#Params=46.1M, Training Setup=Standard2026.04 | 37.8 | — | — | — | — | |
| ODIN-Swin-BInput=Sensor RGBD Point Cloud2024.01 | 36.8 | — | — | — | — | |
| Masked Scene ModelingBackbone=HUNet, Pre-training=Masked Scene Modeling, Fine-tuning=true2025.04 | 35.7 | — | — | — | — | |
| HUNetBackbone=HUNet, Pre-training=Scratch, Fine-tuning=true2025.04 | 35.4 | — | — | — | — | |
| MSCBackbone=HUNet, Pre-training=MSC, Fine-tuning=true2025.04 | 34.9 | — | — | — | — | |
| PonderV2#Params.=41.0M2023.10 | 34.6 | — | — | — | — | |
| CeCoInput=Mesh Sampled Point Cloud2024.01 | 34 | — | — | — | — | |
| OA-CNN#Params=51.5M, Training Setup=Standard2026.04 | 33.3 | — | — | — | — | |
| SparseUNet + PPT#Params.=41.0M2023.10 | 33.2 | — | — | — | — | |
| OctformerInput=Mesh Sampled Point Cloud2024.01 | 32.6 | — | — | — | — | |
| OctFormer#Params=44.0M, Training Setup=Standard2026.04 | 32.6 | — | — | — | — | |
| GCBackbone=SR-UNet, Pre-training=GC, Fine-tuning=true2025.04 | 30 | — | — | — | — | |
| MSCBackbone=SR-UNet, Pre-training=MSC, Fine-tuning=true2025.04 | 28.8 | — | — | — | — | |
| LGroundInput=Mesh Sampled Point Cloud2024.01 | 27.2 | — | — | — | — | |
| CSCBackbone=SR-UNet, Pre-training=CSC, Fine-tuning=true2025.04 | 26.4 | — | — | — | — | |
| PCBackbone=SR-UNet, Pre-training=PC, Fine-tuning=true2025.04 | 26.2 | — | — | — | — | |
| SparseUNet#Params.=39.2M2023.10 | 25.3 | — | — | — | — | |
| MinkUNet#Params=39.2M, Training Setup=Standard2026.04 | 25.3 | — | — | — | — | |
| SR-UNetBackbone=SR-UNet, Pre-training=Scratch, Fine-tuning=true2025.04 | 25 | — | — | — | — | |
| SparseUNet + CSC#Params.=39.2M2023.10 | 24.9 | — | — | — | — | |
| CSC-PretrainPre-training=contrastive learning2023.05 | — | 45.5 | 17.1 | 7.9 | 24.9 | |
| LGroundPre-training=language-driven (CLIP)2023.05 | — | 48.5 | 18.4 | 10.6 | 27.2 | |
| LGround2024.03 | — | — | — | — | 27.2 | |
| MinkowskiNetPre-training=from scratch2023.05 | — | 46.3 | 15.4 | 10.2 | 25.3 | |
| MinkowskiNet2024.03 | — | — | — | — | 25.3 | |
| MinkUNetTraining Strategy=multi-dataset joint training (PPT)2023.12 | — | — | — | — | 25.3 | |
| OA-CNNs2024.03 | — | — | — | — | 33.3 | |
| OctFormerPre-training=from scratch2023.05 | — | 53.9 | 26.5 | 13.1 | 32.6 | |
| OctFormer2024.03 | — | — | — | — | 32.6 | |
| OctFormerTraining Strategy=trained from scratch2023.12 | — | — | — | — | 32.6 | |
| PTv3Training Strategy=trained from scratch2023.12 | — | — | — | — | 37.8 | |
| PTv3Training Strategy=multi-dataset joint training (PPT)2023.12 | — | — | — | — | 39.3 | |
| SupConPre-training=contrastive learning2023.05 | — | 48.6 | 19.2 | 10.3 | 26 |