Open-vocabulary Semantic Segmentation on ScanNet Target View (40 unseen scenes)
74.16mIoULangFlash
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LangFlashPer-Scene Reconstruction Time=0.180s2026.05 | 74.16 | 87.18 | |
| LangFlash (zero-shot)Per-Scene Reconstruction Time=0.180s, Evaluation Protocol=zero-shot2026.05 | 62.65 | 78.61 | |
| Uni3RPer-Scene Recon. Time=0.162s2025.08 | 55.84 | 82.68 | |
| LSegSfM Reconstruction Time=N/A, Per-Scene Reconstruction Time=N/A2026.05 | 52.81 | 76.12 | |
| LSM*Per-Scene Recon. Time=0.108s2025.08 | 50.78 | 76.86 | |
| LSMPer-Scene Reconstruction Time=0.108s2026.05 | 50.78 | 76.86 | |
| LSegSfM Recon. Time=N/A, Per-Scene Recon. Time=N/A2025.08 | 48.19 | 79.27 | |
| Feature-3DGSSfM Recon. Time=20.52s, Per-Scene Recon. Time=18mins2025.08 | 42.23 | 71.74 | |
| Feature-3DGSSfM Reconstruction Time=20.52s, Per-Scene Reconstruction Time=18min36s2026.05 | 42.23 | 71.74 | |
| NeRF-DFFSfM Recon. Time=20.52s, Per-Scene Recon. Time=1min2025.08 | 40.37 | 67.55 | |
| NeRF-DFFSfM Reconstruction Time=20.52s, Per-Scene Reconstruction Time=1min2s2026.05 | 40.37 | 67.55 |