3D box localization on ScanRefer
62.6Accuracy @ 0.25 IoUGPT4Scene-HDM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT4Scene-HDMBackbone=GPT-4o, FT=false2026.05 | 62.6 | 57 | |
| SSR3D-LLMBackbone=Tiny-Vicuna-1B, FT=true2026.05 | 58.7 | 53.9 | |
| SPAZERBackbone=GPT-4o, FT=false2026.05 | 57.2 | 48.8 | |
| Chat-SceneBackbone=Vicuna-7B, FT=true2026.05 | 55.5 | 50.2 | |
| VLM-GrounderBackbone=GPT-4V, FT=false2026.05 | 51.6 | 32.8 | |
| GPT4Scene-HDBackbone=GPT-4o, FT=false2026.05 | 50.9 | 46.4 | |
| Grounded 3D-LLMBackbone=Tiny-Vicuna-1B, FT=true2026.05 | 48.6 | 44 | |
| SeeGroundBackbone=Qwen2-VL-72B, FT=false2026.05 | 44.1 | 39.4 | |
| GPT4SceneBackbone=GPT-4o, FT=false2026.05 | 40.5 | 36.7 | |
| ZSVG3DBackbone=GPT-4 + CLIP, FT=false2026.05 | 36.4 | 32.7 | |
| WS-3DVGBackbone=3DVG net, FT=true2026.05 | 27.37 | 21.96 |