Semantic Segmentation on ScanNet (mIoU Breakdown)
78.5mIoUHUNet
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| HUNetEvaluation Protocol=Fine-tuning2025.04 | 78.5 | — | — | — | — | — | |
| Supervised (HUNet)BB=HUNet, Protocol=Supervised2025.04 | 77 | — | — | — | — | — | |
| SAM-MAEEvaluation Protocol=Fine-tuning2025.04 | 75.4 | — | — | — | — | — | |
| PointContrastPre-training strategy=PointContrast2020.12 | 74.1 | — | — | — | — | — | |
| Bridge3DEvaluation Protocol=Fine-tuning2025.04 | 73.9 | — | — | — | — | — | |
| Contrastive Scene ContextsPre-training strategy=Contrastive Scene Contexts2020.12 | 73.8 | — | — | — | — | — | |
| nD-sincos2026.02 | 72.6 | — | — | — | — | — | |
| Supervised (SR-UNet)BB=SR-UNet, Protocol=Supervised2025.04 | 72.2 | — | — | — | — | — | |
| ScratchPre-training strategy=None (from scratch)2020.12 | 72.2 | — | — | — | — | — | |
| RoPE2026.02 | 71.7 | — | — | — | — | — | |
| RoPE-Mixed2026.02 | 71.1 | — | — | — | — | — | |
| PaPE2026.02 | 71 | — | — | — | — | — | |
| nD-ALiBi2026.02 | 70.6 | — | — | — | — | — | |
| PaPE-RIrotation-invariant=true2026.02 | 69.3 | — | — | — | — | — | |
| HUNetEvaluation Protocol=Linear probing2025.04 | 68.7 | — | — | — | — | — | |
| OursBB=HUNet, Protocol=Linear2025.04 | 68.7 | — | — | — | — | — | |
| Contrastive Scene ContextsSettings=LA (200 points)2020.12 | 68.2 | — | — | — | — | — | |
| PointContrastSettings=LA (200 points)2020.12 | 67.8 | — | — | — | — | — | |
| OursBB=HUNet, Protocol=NN2025.04 | 65.7 | — | — | — | — | — | |
| ScratchSettings=LA (200 points)2020.12 | 65.5 | — | — | — | — | — | |
| DUNEEvaluation Protocol=linear layer, DINO teacher projector=true2025.03 | 65.2 | — | — | — | — | — | |
| Contrastive Scene ContextsSettings=LR (240 scenes)2020.12 | 64.6 | — | — | — | — | — | |
| PointContrastSettings=LR (240 scenes)2020.12 | 63 | — | — | — | — | — | |
| ScratchSettings=LR (240 scenes)2020.12 | 62.9 | — | — | — | — | — | |
| Pri3DEvaluation Protocol=linear layer2025.03 | 61.7 | — | — | — | — | — | |
| DUNE (no proj.)Evaluation Protocol=linear layer, DINO teacher projector=false2025.03 | 61.2 | — | — | — | — | — | |
| MSC (HUNet)BB=HUNet, Protocol=Linear2025.04 | 58.2 | — | — | — | — | — | |
| MASt3REvaluation Protocol=linear layer2025.03 | 57 | — | — | — | — | — | |
| Ours_SegformerBackbone=Segformer, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 55.3 | — | — | — | — | — | |
| Valada et al.Training Dataset=ScanNet, Evaluation Protocol=Supervised2022.02 | 52.9 | — | — | — | — | — | |
| Ours_HRNetBackbone=HRNet, Training Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 52 | — | — | — | — | — | |
| MSegTraining Dataset=Mixed, Evaluation Protocol=Zero-shot2022.02 | 48.4 | — | — | — | — | — | |
| HRNet (ADE)Backbone=HRNet, Training Dataset=ADE, Evaluation Protocol=Zero-shot2022.02 | 43.8 | — | — | — | — | — | |
| HRNet (SUN)Backbone=HRNet, Training Dataset=SUN, Evaluation Protocol=Zero-shot2022.02 | 42.2 | — | — | — | — | — | |
| MSC (HUNet)BB=HUNet, Protocol=NN2025.04 | 39.9 | — | — | — | — | — | |
| MSC (SR-UNet)BB=SR-UNet, Protocol=Linear2025.04 | 37.3 | — | — | — | — | — | |
| OESSLBB=SR-UNet, Protocol=Linear2025.04 | 35.4 | — | — | — | — | — | |
| HRNet (COCO)Backbone=HRNet, Training Dataset=COCO, Evaluation Protocol=Zero-shot2022.02 | 33.9 | — | — | — | — | — | |
| DeFMBackbone=ViT-L/142026.01 | 31.34 | — | — | — | — | — | |
| MSC (SR-UNet)BB=SR-UNet, Protocol=NN2025.04 | 31.3 | — | — | — | — | — | |
| OESSLBB=SR-UNet, Protocol=NN2025.04 | 31 | — | — | — | — | — | |
| DeFMBackbone=ResNet-502026.01 | 29.09 | — | — | — | — | — | |
| DINOv3Backbone=ViT-L/162026.01 | 28.52 | — | — | — | — | — | |
| DeFMBackbone=ResNet-342026.01 | 27.79 | — | — | — | — | — | |
| DeFMBackbone=ViT-S/142026.01 | 27.69 | — | — | — | — | — | |
| CSCBB=SR-UNet, Protocol=Linear2025.04 | 27.3 | — | — | — | — | — | |
| MM3DBB=PT, Protocol=Linear2025.04 | 26.7 | — | — | — | — | — | |
| C-RADIOv3Backbone=ViT-L/16 (CPE)2026.01 | 25.56 | — | — | — | — | — | |
| DINOv2Backbone=ViT-L/142026.01 | 24.46 | — | — | — | — | — | |
| CSCBB=SR-UNet, Protocol=NN2025.04 | 24.1 | — | — | — | — | — | |
| DeFMBackbone=ResNet-182026.01 | 22.47 | — | — | — | — | — | |
| DINOv3Backbone=ViT-S/162026.01 | 20.05 | — | — | — | — | — | |
| MM3DBB=PT, Protocol=NN2025.04 | 19.3 | — | — | — | — | — | |
| DINOv2Backbone=ViT-S/142026.01 | 18.31 | — | — | — | — | — | |
| TheiaBackbone=DeiT-S/162026.01 | 14.71 | — | — | — | — | — | |
| HRNet (Mappilary)Backbone=HRNet, Training Dataset=Mappilary, Evaluation Protocol=Zero-shot2022.02 | 2.1 | — | — | — | — | — | |
| HRNet (Cityscapes)Backbone=HRNet, Training Dataset=Cityscapes, Evaluation Protocol=Zero-shot2022.02 | 1.7 | — | — | — | — | — | |
| HRNet (IDD)Backbone=HRNet, Training Dataset=IDD, Evaluation Protocol=Zero-shot2022.02 | 1.6 | — | — | — | — | — | |
| HRNet (BDD)Backbone=HRNet, Training Dataset=BDD, Evaluation Protocol=Zero-shot2022.02 | 1.4 | — | — | — | — | — | |
| 3DGenZBackbone Training Set=S, Classifier Training Set=S ∪ U2021.08 | — | 32.8 | 7.7 | 27.8 | 12.5 | — | |
| DeViSe-3DSegBackbone Training Set=S, Classifier Training Set=U, Adaptation=Repaired2021.08 | — | 12.8 | 3 | 10.9 | 4.8 | — | |
| DeViSe-3DSeg*Backbone Training Set=S, Classifier Training Set=U, Adaptation=Direct, unrepaired2021.08 | — | 20 | 0 | 16 | 0 | — | |
| DM-NeRF2023.03 | — | — | — | — | — | 70.71 | |
| Full supervisionBackbone Training Set=S ∪ U, Classifier Training Set=S ∪ U2021.08 | — | 43.3 | 51.9 | 45.1 | 47.2 | — | |
| Nerflets2023.03 | — | — | — | — | — | 73.63 | |
| PSPNetInput source=GT Image2023.03 | — | — | — | — | — | 68.43 | |
| PSPNetInput source=NeRF Im.2023.03 | — | — | — | — | — | 46.21 | |
| Semantic-NeRF2023.03 | — | — | — | — | — | 71.34 | |
| ZSL backboneBackbone Training Set=S, Classifier Training Set=S ∪ U2021.08 | — | 41.5 | 39.2 | 40.3 | 40.3 | — | |
| ZSL-trivialBackbone Training Set=S, Classifier Training Set=S2021.08 | — | 39.2 | 0 | 31.3 | 0 | — | |
| ZSLPC-SegBackbone Training Set=S, Classifier Training Set=U, Adaptation=Repaired2021.08 | — | 16.4 | 4.2 | 13.9 | 6.7 | — | |
| ZSLPC-Seg*Backbone Training Set=S, Classifier Training Set=U, Adaptation=Direct, unrepaired2021.08 | — | 28.2 | 0 | 22.6 | 0 | — |