Semantic Segmentation on Structured3D (val)
85.4mIoULitePT-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LitePT-L#Params=85.9M, Latency=44ms, Memory=3.58G2025.12 | 85.4 | — | |
| LitePT-B#Params=45.1M, Latency=36ms, Memory=2.60G2025.12 | 85.1 | — | |
| LitePT-S#Params=12.7M, Latency=23ms, Memory=2.56G2025.12 | 83.6 | — | |
| LitePT-S#Params=12.7M2025.12 | 83.6 | 90.7 | |
| PTv3#Params=46.1M, Latency=57ms, Memory=5.83G2025.12 | 82.4 | — | |
| PTv3#Params=46.1M2025.12 | 82.4 | 90.3 | |
| PTv3-Structured3DParams=46M, Activated=46M, Training Setting=Single-dataset Training2025.05 | 81.5 | — | |
| PTv2#Params=12.8M2025.12 | 79 | 86.8 | |
| PTv3-Structured3DParams=46M, Activated=46M, Training Setting=Single-dataset Training, Precise Evaluator=false2025.05 | 78 | — | |
| MinkUNet#Params=39.2M2025.12 | 76.4 | 84.3 | |
| OURSModal=RGB-D-N2023.08 | 75.86 | — | |
| OURSModal=RGB-N2023.08 | 74.38 | — | |
| OURSModal=RGB-D2023.08 | 73.78 | — | |
| OURSModal=RGB2023.08 | 71.94 | — | |
| Point-MoE-LParams=100M, Activated=60M, Precise Evaluator (None)=None, Joint indoor-outdoor training=true2025.05 | 70.1 | — | |
| HoHoNetModal=RGB-D2023.08 | 69.51 | — | |
| Point-MoE-LParams=100M, Activated=59M, Joint indoor and outdoor training=true2025.05 | 69.5 | — | |
| Point-MoE-LParams=100M, Activated=59M, Training Setting=Multi-dataset Joint Training2025.05 | 69.5 | — | |
| Point-MoE-LParams=100M, Activated=60M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 69.3 | — | |
| Point-MoE-SParams=59M, Activated=52M, Training Setting=Multi-dataset Joint Training2025.05 | 69 | — | |
| PPT-LParams=98M, Activated=98M, Precise Evaluator (None)=None, Joint indoor-outdoor training=true2025.05 | 67.5 | — | |
| PPT-L*Params=98M, Activated=98M, Joint indoor and outdoor training=true, use dataset labels during training=true2025.05 | 67.5 | — | |
| PTv3-LParams=97M, Activated=97M, Training Setting=Multi-dataset Joint Training, Mixed Dataset Batch=true, Layernorm=true, Precise Evaluator=false2025.05 | 67.4 | — | |
| Point-MoE-SParams=59M, Activated=52M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 66.9 | — | |
| Trans4PASS+Modal=RGB2023.08 | 66.74 | — | |
| HoHoNetModal=RGB2023.08 | 66.09 | — | |
| PPT-LParams=98M, Activated=98M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 64.9 | — | |
| PPT-L*Params=98M, Activated=98M, Training Setting=Multi-dataset Joint Training2025.05 | 64.7 | — | |
| PPT-S*Params=47M, Activated=47M, Training Setting=Multi-dataset Joint Training2025.05 | 64.2 | — | |
| PTv3-LParams=97M, Activated=97M, Joint indoor and outdoor training=true2025.05 | 64.1 | — | |
| PTv3-L*Params=97M, Activated=97M, Precise Evaluator (None)=None, Joint indoor-outdoor training=true, Training batch composition=Mix dataset batch2025.05 | 61.9 | — | |
| PTv3-L**Params=97M, Activated=97M, Precise Evaluator (None)=None, Joint indoor-outdoor training=true, Training batch composition=Mix dataset batch, Normalization type (layernorm)=Yes2025.05 | 61.3 | — | |
| PanoFormerModal=RGB-D2023.08 | 60.98 | — | |
| OA-CNNsParams=52M, Activated=52M, Training Setting=Multi-dataset Joint Training2025.05 | 59 | — | |
| PPT-SParams=47M, Activated=47M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 58.2 | — | |
| PTv3-LParams=97M, Activated=97M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 58.1 | — | |
| PTv3-SParams=46M, Activated=46M, Training Setting=Multi-dataset Joint Training, Precise Evaluator=false2025.05 | 57.8 | — | |
| PTv3-LParams=97M, Activated=97M, Training Setting=Multi-dataset Joint Training, Mixed Dataset Batch=true, Precise Evaluator=false2025.05 | 57.5 | — | |
| PTv3-SParams=46M, Activated=46M, Training Setting=Multi-dataset Joint Training2025.05 | 56.6 | — | |
| PTv3-LParams=97M, Activated=97M, Training Setting=Multi-dataset Joint Training2025.05 | 56 | — | |
| PTv3-SParams=46M, Activated=46M, Training Setting=Multi-dataset Joint Training, Mixed Dataset Batch=true, Layernorm=true, Precise Evaluator=false2025.05 | 56 | — | |
| PanoFormerModal=RGB2023.08 | 55.57 | — | |
| PTv3-LParams=97M, Activated=97M, Precise Evaluator (None)=None, Joint indoor-outdoor training=true, Training batch composition=Standard2025.05 | 47.6 | — | |
| PTv3-SParams=46M, Activated=46M, Training Setting=Multi-dataset Joint Training, Mixed Dataset Batch=true, Precise Evaluator=false2025.05 | 45.9 | — | |
| PTv3-Matterport3DParams=46M, Activated=46M, Training Setting=Single-dataset Training, Precise Evaluator=false2025.05 | 23 | — | |
| PTv3-ScanNetParams=46M, Activated=46M, Training Setting=Single-dataset Training2025.05 | 19.8 | — | |
| PTv3-ScanNetParams=46M, Activated=46M, Training Setting=Single-dataset Training, Precise Evaluator=false2025.05 | 19.4 | — | |
| PTv3-S3DISParams=46M, Activated=46M, Training Setting=Single-dataset Training2025.05 | 3.5 | — | |
| PTv3-S3DISParams=46M, Activated=46M, Training Setting=Single-dataset Training, Precise Evaluator=false2025.05 | 3.4 | — |