Semantic Segmentation on ScanNet200 (val)
40.9mIoUChorus
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ChorusEvaluation Protocol=fine-tuned2025.12 | 40.9 | — | — | — | 52.3 | 84.1 | |
| Volt-B#Params=94.3M, Training Setup=Jointly trained on multiple datasets2026.04 | 40 | — | — | — | — | — | |
| UtoniaProtocol=fine-tuning, Learnable Parameters=157.7M, Parameter Percentage=100%2026.03 | 39.6 | — | — | — | 51.4 | 85.1 | |
| ConcertoLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 39.2 | — | — | — | 50.2 | 85 | |
| ConcertoLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 39.2 | — | — | — | 50.2 | 85 | |
| ConcertoProtocol=fine-tuning, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 39.2 | — | — | — | 50.2 | 85 | |
| Sonata + DINOv2.5Evaluation Protocol=decoder2025.03 | 38.27 | — | — | — | 48.57 | 83.77 | |
| Volt-S#Params=23.7M, Training Setup=Jointly trained on multiple datasets2026.04 | 38.1 | — | — | — | — | — | |
| UtoniaProtocol=decoder tuning, Learnable Parameters=20.5M, Parameter Percentage=13%2026.03 | 38 | — | — | — | 49.9 | 84.9 | |
| ConcertoProtocol=decoder tuning, Learnable Parameters=16.3M, Parameter Percentage=13%2026.03 | 37.8 | — | — | — | 50.5 | 84.1 | |
| Sonata + DINOv2Evaluation Protocol=decoder2025.03 | 37.73 | — | — | — | 49.38 | 83.31 | |
| D-DITRProtocol=Fine-Tuning, Additional Data=false2025.12 | 37.7 | — | — | — | — | — | |
| PTv3/PPT#Params=124.8M, Training Setup=Jointly trained on multiple datasets2026.04 | 37.5 | — | — | — | — | — | |
| ConcertoProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 37.4 | — | — | — | 49.5 | 83.3 | |
| DoReMiSource=-2025.11 | 37.2 | — | — | — | 47.9 | 84.4 | |
| DOSProtocol=Fine-Tuning, Additional Data=true2025.12 | 37.1 | — | — | — | 46.8 | — | |
| Sonata + DINOv2.5Evaluation Protocol=linear2025.03 | 36.96 | — | — | — | 48.23 | 82.77 | |
| SonataProtocol=Fine-Tuning, Additional Data=true2025.12 | 36.8 | — | — | — | 46.5 | — | |
| SonataLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 36.8 | — | — | — | 46.5 | 84.4 | |
| SonataLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 36.8 | — | — | — | 46.5 | 84.4 | |
| SonataProtocol=fine-tuning, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 36.8 | — | — | — | 46.5 | 84.4 | |
| SonataSource=CVPR 20252025.11 | 36.8 | — | — | — | 46.5 | 84.4 | |
| DOSProtocol=Fine-Tuning, Additional Data=false2025.12 | 36.7 | — | — | — | 46.6 | — | |
| DOSProtocol=Fine-tuning2026.03 | 36.7 | — | — | — | — | — | |
| Sonata + DINOv2Evaluation Protocol=linear2025.03 | 36.67 | — | — | — | 46.98 | 82.85 | |
| PointINSProtocol=Fine-tuning2026.03 | 36.6 | — | — | — | — | — | |
| UtoniaProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 36.4 | — | — | — | 49.8 | 83.4 | |
| CDSegNetSource=CVPR 20252025.11 | 36.3 | — | — | — | 45.9 | 83.9 | |
| Volt-S#Params=23.7M, Training Setup=Standard2026.04 | 36.2 | — | — | — | — | — | |
| UniPre3DBackbone=PTv3, Pre-training=UniPre3D2025.06 | 36 | — | — | — | — | — | |
| PTv3Training Strategy=multi-dataset joint training (PPT)2023.12 | 36 | — | — | — | — | — | |
| ChorusEvaluation Protocol=linear probing2025.12 | 36 | — | — | — | 47.2 | 82.8 | |
| PPTProtocol=supervised, Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 36 | — | — | — | 46.2 | 83.8 | |
| PPTSource=CVPR 20242025.11 | 36 | — | — | — | 46.2 | 83.8 | |
| MSMProtocol=Fine-Tuning, Additional Data=false2025.12 | 35.7 | — | — | — | — | — | |
| PTv3Protocol=Supervised, Additional Data=false2025.12 | 35.3 | — | — | — | 46 | — | |
| PTv3Learnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 35.3 | — | — | — | 46 | 83.4 | |
| PTv3Learnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 35.3 | — | — | — | 46 | 83.4 | |
| PTv3Learnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 35.3 | — | — | — | 46 | 83.4 | |
| PTv3 (sup.)Protocol=Supervised2026.03 | 35.3 | — | — | — | — | — | |
| PTv3Source=CVPR 20242025.11 | 35.3 | — | — | — | 46 | 83.4 | |
| PTv3Backbone=PTv3, Pre-training=None2025.06 | 35.2 | — | — | — | — | — | |
| PTv3Training Strategy=trained from scratch2023.12 | 35.2 | — | — | — | — | — | |
| PTv3#Params=46.1M, Training Setup=Standard2026.04 | 35.2 | — | — | — | — | — | |
| PTv3Evaluation Protocol=supervised2025.12 | 34.7 | — | — | — | 45.4 | 83.5 | |
| SonataEvaluation Protocol=fine-tuned2025.12 | 34.4 | — | — | — | 44 | 84 | |
| SonataProtocol=Fine-tuning2026.03 | 34.4 | — | — | — | — | — | |
| PointINSProtocol=Decoder2026.03 | 33.9 | — | — | — | — | — | |
| SegContrastProtocol=Fine-tuning2026.03 | 33.8 | — | — | — | — | — | |
| DOSProtocol=Decoder2026.03 | 33.7 | — | — | — | — | — | |
| SonataEvaluation Protocol=decoder2025.03 | 33.54 | — | — | — | 44.48 | 84.07 | |
| SonataProtocol=decoder tuning, Learnable Parameters=16.3M, Parameter Percentage=13%2026.03 | 33.5 | — | — | — | 44.5 | 84.1 | |
| PSAProtocol=Fine-tuning2026.03 | 33.5 | — | — | — | — | — | |
| MSCEvaluation Protocol=fine-tuned2025.12 | 33.4 | — | — | — | 43.7 | 83.4 | |
| MSCLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 33.4 | — | — | — | 43.7 | 83.4 | |
| MSCLearnable Parameters=124.8M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 33.4 | — | — | — | 43.7 | 83.4 | |
| MSCLearnable Parameters=124.8M, Parameter Percentage=100%2026.03 | 33.4 | — | — | — | 43.7 | 83.4 | |
| UniPre3DBackbone=SparseUNet, Pre-training=UniPre3D2025.06 | 33 | — | — | — | — | — | |
| NOMAEProtocol=Fine-tuning2026.03 | 33 | — | — | — | — | — | |
| OctFormerBackbone=OctFormer, Pre-training=None2025.06 | 32.6 | — | — | — | — | — | |
| OctFormerTraining Strategy=trained from scratch2023.12 | 32.6 | — | — | — | — | — | |
| OctFormer#Params=44.0M, Training Setup=Standard2026.04 | 32.6 | — | — | — | — | — | |
| ChorusEvaluation Protocol=decoder2025.12 | 32.5 | — | — | — | 43 | 82.2 | |
| PonderV2+Backbone=SparseUNet, Pre-training=PonderV2† (Single-dataset)2025.06 | 32.4 | — | — | — | — | — | |
| PonderV2Backbone=SparseUNet, Pre-training=PonderV22025.06 | 32.3 | — | — | — | — | — | |
| OA-CNNs2024.03 | 32.3 | 51.3 | 28 | 17.7 | — | — | |
| PonderV2#Params.=41.0M2023.10 | 32.3 | — | — | — | — | — | |
| OA-CNN#Params=51.5M, Training Setup=Standard2026.04 | 32.3 | — | — | — | — | — | |
| MSCLearnable Parameters=39.2M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 32 | — | — | — | 41.6 | 82.3 | |
| MSCLearnable Parameters=39.2M, Percentage of Parameters=100%, Fine-tuning Protocol=Full fine-tuning2025.10 | 32 | — | — | — | 41.6 | 82.3 | |
| SparseUNet + PPT#Params.=41.0M2023.10 | 31.9 | — | — | — | — | — | |
| SonataProtocol=Decoder2026.03 | 31.6 | — | — | — | — | — | |
| SPG(PTv2)input=point, Params. (M)=3.9/11.32024.08 | 31.5 | — | — | — | — | — | |
| DOSProtocol=Linear Probing, Additional Data=true2025.12 | 30.7 | — | — | — | 41.7 | — | |
| NOMAEProtocol=Decoder2026.03 | 30.5 | — | — | — | — | — | |
| PPT(Unsup.)Backbone=SparseUNet, Pre-training=PPT(Unsup.)2025.06 | 30.4 | — | — | — | — | — | |
| PTv2Backbone=PTv2, Pre-training=None2025.06 | 30.2 | — | — | — | — | — | |
| PTv2Training Strategy=trained from scratch2023.12 | 30.2 | — | — | — | — | — | |
| PTv2input=point, Params. (M)=3.9/11.32024.08 | 30.2 | — | — | — | — | — | |
| PTv2#Params.=12.8M2023.10 | 30.2 | — | — | — | — | — | |
| PTv2#Params=12.8M, Training Setup=Standard2026.04 | 30.2 | — | — | — | — | — | |
| OneFormer3D2023.11 | 30.1 | — | — | — | — | — | |
| SonataEvaluation Protocol=decoder2025.12 | 30.1 | — | — | — | 39.4 | 83 | |
| PointINSProtocol=Linear Probing2026.03 | 29.6 | — | — | — | — | — | |
| PTv22024.03 | 29.3 | — | — | — | — | — | |
| SonataProtocol=Linear Probing, Additional Data=true2025.12 | 29.3 | — | — | — | 41.6 | — | |
| SonataProtocol=linear probing, Learnable Parameters=<0.2M, Parameter Percentage=<0.2%2026.03 | 29.3 | — | — | — | 41.6 | 81.2 | |
| SonataEvaluation Protocol=linear2025.03 | 29.25 | — | — | — | 41.61 | 81.15 | |
| SPG(PTv1)input=point, Params. (M)=7.82024.08 | 29.1 | — | — | — | — | — | |
| DOSProtocol=Linear Probing, Additional Data=false2025.12 | 29.1 | — | — | — | 41.1 | — | |
| DOSProtocol=Linear Probing2026.03 | 29.1 | — | — | — | — | — | |
| MinkUNet + LGroundcontext_enhancement=LGround2023.11 | 28.9 | — | — | — | — | — | |
| LGround2024.03 | 28.9 | 51.5 | 22.7 | 12.5 | — | — | |
| language-grounded 3D pre-training2022.04 | 28.87 | 51.51 | 22.68 | 1,241 | — | — | |
| MSCBackbone=SparseUNet, Pre-training=MSC2025.06 | 28.8 | — | — | — | — | — | |
| MSCBackbone=SparseUNet, Pre-training=Masked Scene Contrast2023.03 | 28.8 | — | — | — | — | — | |
| SparseUNet2024.03 | 28.8 | — | — | — | — | — | |
| SparseUNet + MSC#Params.=39.2M2023.10 | 28.8 | — | — | — | — | — | |
| SonataEvaluation Protocol=linear probing2025.12 | 28.8 | — | — | — | 38.8 | 81.8 | |
| PTv1Backbone=PTv1, Pre-training=None2025.06 | 27.8 | — | — | — | — | — |