Grounded Visual Question Answering on RoboSpatial-Home
54.92Context ScoreSNOW
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SNOWsetting=fully training-free, spatial representation=4DSG, backbone VLM=Gemma3-4B-IT, video predictor=SAM2 Hiera Large2025.12 | 54.92 | 84.55 | 78.1 | 72.29 | |
| RoboPointfinetuned on RoboSpatial=true2025.12 | 31.1 | 78 | 81 | 63.4 | |
| NaviMasterfinetuned on RoboSpatial=false2025.12 | 21.65 | — | — | — | |
| LLaVA-NeXTfinetuned on RoboSpatial=true2025.12 | 19.7 | 78.9 | 80.1 | 59.6 | |
| RoboPointfinetuned on RoboSpatial=false2025.12 | 19.7 | 69.9 | 70.5 | 53.4 | |
| VILAfinetuned on RoboSpatial=true2025.12 | 15.6 | 65.9 | 78 | 53.2 | |
| SpaceLLaVAfinetuned on RoboSpatial=true2025.12 | 13.1 | 71.6 | 72.4 | 52.4 | |
| LEOfinetuned on RoboSpatial=true2025.12 | 10 | 64.2 | 57.1 | 43.8 | |
| 3D-LLMfinetuned on RoboSpatial=true2025.12 | 8.2 | 55.2 | 52.3 | 37.6 | |
| GPT-4ofinetuned on RoboSpatial=false2025.12 | 5.7 | 77.2 | 58.1 | 47 | |
| SpaceLLaVAfinetuned on RoboSpatial=false2025.12 | 2.5 | 61 | 61 | 41.5 | |
| Molmofinetuned on RoboSpatial=false2025.12 | 0.1 | 58.6 | 18.1 | 25.6 | |
| VILAfinetuned on RoboSpatial=false2025.12 | 0 | 57.8 | 69 | 42.3 | |
| LLaVA-NeXTfinetuned on RoboSpatial=false2025.12 | 0 | 68.3 | 70.5 | 46.3 | |
| 3D-LLMfinetuned on RoboSpatial=false2025.12 | 0 | 39.8 | 35.2 | 25 | |
| LEOfinetuned on RoboSpatial=false2025.12 | 0 | 51.2 | 38.1 | 29.8 |