Omnidirectional 3D occupancy prediction on H3O Homo (within-city)
37.29mIoUOneOcc
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OneOccProtocol=Fully-supervised, Input=Camera2026.03 | 37.29 | 63.82 | 62.92 | 22.86 | 33.74 | 17.79 | 6.47 | 26.58 | 33.45 | 41.03 | 71.13 | 26.55 | 46.24 | |
| MonoSceneProtocol=Fully-supervised, Input=Camera2026.03 | 33.46 | 62.45 | 57.18 | 19.97 | 29.76 | 13.77 | 5.03 | 16.76 | 29.27 | 38.91 | 70.15 | 20.67 | 43.24 | |
| SGN-TProtocol=Fully-supervised, Input=Camera2026.03 | 28.64 | 54.55 | 44.61 | 15.51 | 23.91 | 7.68 | 4.52 | 15.77 | 23.79 | 35.16 | 65.24 | 19.46 | 39.95 | |
| SGN-SProtocol=Fully-supervised, Input=Camera2026.03 | 28.56 | 54.81 | 47.44 | 15.64 | 24.23 | 8.53 | 2.62 | 13.51 | 23.83 | 33.22 | 65.88 | 19.72 | 39.61 | |
| OccFormerProtocol=Fully-supervised, Input=Camera2026.03 | 24.88 | 54.11 | 46.41 | 15.14 | 17.57 | 4.3 | 0 | 1.65 | 19.88 | 32.84 | 65.08 | 11.72 | 36.55 | |
| OursProtocol=Open-vocabulary, Input=Camera, Backbone=MonoScene2026.03 | 24.25 | 42.08 | 25.55 | 17.4 | 22.49 | 0 | 0 | 0.03 | 15.36 | 39.16 | 70.2 | 25.61 | 44.99 | |
| OVOProtocol=Open-vocabulary, Input=Camera, Backbone=MonoScene2026.03 | 23.39 | 38.69 | 14.3 | 18.46 | 21.48 | 3.67 | 0.15 | 0 | 13.82 | 40.36 | 70.67 | 26.17 | 45.73 | |
| Ours (SGN-S)Protocol=Open-vocabulary, Input=Camera, Backbone=SGN-S2026.03 | 22.45 | 39.07 | 26.68 | 14.51 | 18.6 | 0 | 0 | 0 | 14.12 | 37.15 | 65.66 | 22.82 | 41.88 | |
| OVO (SGN-S)Protocol=Open-vocabulary, Input=Camera, Backbone=SGN-S2026.03 | 21.4 | 39.23 | 24.28 | 12.49 | 16.73 | 1.7 | 0.62 | 0 | 13.58 | 33.9 | 66.84 | 18.16 | 39.63 | |
| VoxFormer-SProtocol=Fully-supervised, Input=Camera2026.03 | 11.09 | 22.27 | 17.44 | 2.86 | 0.87 | 0.14 | 0 | 0 | 6.22 | 5.65 | 61.46 | 0.18 | 22.43 |