Visual Grounding on ScanRefer v1 (val)
84Acc@0.5 (Unique)Proxy3D
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Proxy3DVision modal.=I, # of tokens=700, Backbone=Qwen2.5-VL-7B2026.05 | 84 | — | — | 59.6 | 54.1 | — | — | — | |
| GPT4SceneVenue=null, Input Modalities=Images + camera poses + depths, Supervision bboxes=true, Supervision texts=true2026.02 | 83.7 | 50.9 | 57 | — | — | 90.3 | 56.4 | 62.6 | |
| GPT4Scene (HDM)Vision modal.=B,I, # of tokens=80002026.05 | 83.7 | — | — | 62.6 | 57 | — | — | — | |
| Descrip3DVision modal.=I2026.05 | 83.2 | — | — | 57.2 | 51.8 | — | — | — | |
| Chat-SceneVision modal.=P2026.05 | 82.5 | — | — | 55.5 | 50.2 | — | — | — | |
| Video-3D-LLMVision modal.=I, # of tokens=80002026.05 | 78.3 | — | — | 58.1 | 51.7 | — | — | — | |
| 3DRSVision modal.=I, # of tokens=80002026.05 | 77.9 | — | — | 62.9 | 56.1 | — | — | — | |
| ROSS3DVenue=ICCV’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=true, Supervision texts=true2026.02 | 77.4 | 48.9 | 54.4 | — | — | 87.2 | 54.8 | 61.1 | |
| M3DRef-CLIP2024.10 | 77.2 | 36.8 | 44.7 | — | — | — | — | — | |
| Video-3D LLMVenue=CVPR’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=true, Supervision texts=true2026.02 | 77 | 45 | 51.2 | — | — | 86.6 | 50.9 | 57.9 | |
| M3DRef-CLIPNMS (Non-maximum suppression)=true2024.10 | 75.6 | 38.5 | 45.7 | — | — | — | — | — | |
| D-LISA2024.10 | 75.5 | 40 | 46.9 | — | — | — | — | — | |
| Z3DVenue=null, Input Modalities=Images + camera poses + depths, Supervision bboxes=Mask3D, Supervision texts=false2026.02 | 74.8 | 45.7 | 52.7 | — | — | 82.3 | 51.5 | 58.9 | |
| LIBAVenue=AAAI’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=true, Supervision texts=true2026.02 | 74.3 | 44.4 | 49 | — | — | 88.8 | 54.4 | 59.6 | |
| UniT3DExtra captioning training data=true2024.10 | 73.1 | 31.1 | 39.1 | — | — | — | — | — | |
| LEOVision modal.=P,I2026.05 | 72.4 | — | — | 38.2 | — | — | — | — | |
| D3NetExtra captioning training data=true2024.10 | 72 | 30.1 | 37.9 | — | — | — | — | — | |
| SeeGroundVenue=CVPR’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=Mask3D, Supervision texts=false2026.02 | 68.9 | 30 | 39.4 | — | — | 75.7 | 34 | 44.1 | |
| FFL-3DOG2024.10 | 67.9 | 25.7 | 34 | — | — | — | — | — | |
| HAM2024.10 | 67.9 | 34 | 40.6 | — | — | — | — | — | |
| CORE-3DVG2024.10 | 67.1 | 39.8 | 43.8 | — | — | — | — | — | |
| InstanceRefer2024.10 | 66.8 | 24.8 | 32.9 | — | — | — | — | — | |
| 3DJCGExtra captioning training data=true2024.10 | 64.3 | 30.8 | 37.3 | — | — | — | — | — | |
| Z3DVenue=null, Input Modalities=Images + camera poses + depths, Supervision bboxes=false, Supervision texts=false2026.02 | 64 | 40.3 | 46 | — | — | 73.9 | 47.8 | 54.2 | |
| 3DVG-Trans2024.10 | 62 | 30.3 | 36.4 | — | — | — | — | — | |
| CSVGVenue=BMVC’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=Mask3D, Supervision texts=false2026.02 | 61.2 | 27.3 | 39.8 | — | — | 68.8 | 38.4 | 49.6 | |
| ZSVG3DVenue=CVPR’24, Input Modalities=Images + camera poses + depths, Supervision bboxes=Mask3D, Supervision texts=false2026.02 | 58.4 | 24.6 | 32.7 | — | — | 63.8 | 27.7 | 36.4 | |
| TGNN2024.10 | 56.8 | 23.2 | 29.7 | — | — | — | — | — | |
| ScanReferVision modal.=P, # of tokens=2562026.05 | 53.5 | — | — | 37.3 | 24.3 | — | — | — | |
| DUSt3R → Z3DVenue=null, Input Modalities=Images + camera poses, Supervision bboxes=false, Supervision texts=false2026.02 | 32 | 22.6 | 24.8 | — | — | 56.7 | 38.4 | 42.8 | |
| DUSt3R → SeeGroundVenue=null, Input Modalities=Images + camera poses, Supervision bboxes=false, Supervision texts=false2026.02 | 27.4 | 12.6 | 16.2 | — | — | 44.5 | 21.1 | 26.8 | |
| DUSt3R → Z3DVenue=null, Input Modalities=Images, Supervision bboxes=false, Supervision texts=false2026.02 | 21.9 | 10.1 | 12.9 | — | — | 42.7 | 27.5 | 31.2 | |
| DUSt3R → SeeGroundVenue=null, Input Modalities=Images, Supervision bboxes=false, Supervision texts=false2026.02 | 17.5 | 5.2 | 8.2 | — | — | 35.2 | 13.9 | 19 | |
| OpenSceneVenue=CVPR’23, Input Modalities=Images + camera poses + depths, Supervision bboxes=false, Supervision texts=false2026.02 | 13.1 | 4.4 | 6.5 | — | — | 20.1 | 11.1 | 13.2 | |
| Qwen2-VL-7BVision modal.=I, # of tokens=80002026.05 | 6.3 | — | — | 5.4 | 5.1 | — | — | — | |
| 3D-LLM(BLIP2-flant5)3D Generalist=false2024.11 | — | — | — | 30.3 | — | — | — | — | |
| 3D-LLM(Flamingo)3D Generalist=false2024.11 | — | — | — | 21.2 | — | — | — | — | |
| 3D-VisTA3D Generalist=false2024.11 | — | — | — | 50.6 | 45.8 | — | — | — | |
| 3DVG-Trans3D Generalist=false2024.11 | — | — | — | 45.9 | 34.5 | — | — | — | |
| Chat-3D v23D Generalist=true2024.11 | — | — | — | 42.5 | 38.4 | — | — | — | |
| ChatScene3D Generalist=true2024.11 | — | — | — | 55.5 | 50.2 | — | — | — | |
| Grounded 3D-LLM3D Generalist=true2024.11 | — | — | — | 47.9 | 44.1 | — | — | — | |
| LLaVA-3D3D Generalist=true2024.11 | — | — | — | 54.1 | 42.4 | — | — | — | |
| LLaVA-3DVenue=ICCV’25, Input Modalities=Images + camera poses + depths, Supervision bboxes=true, Supervision texts=true2026.02 | — | — | 42.7 | — | — | — | — | 50.1 | |
| LLaVA-3DVision modal.=D,I, # of tokens=30962026.05 | — | — | — | 54.1 | 42.4 | — | — | — | |
| LLM-GrounderVenue=ICRA’24, Input Modalities=Images + camera poses + depths, Supervision bboxes=false, Supervision texts=false2026.02 | — | — | 5.3 | — | — | — | — | 17.1 | |
| M3DRef-CLIP3D Generalist=false2024.11 | — | — | — | 51.9 | 44.7 | — | — | — | |
| MVT3D Generalist=false2024.11 | — | — | — | 40.8 | 33.3 | — | — | — | |
| PQ3D3D Generalist=true2024.11 | — | — | — | 57 | 51.2 | — | — | — | |
| ScanRefer3D Generalist=false2024.11 | — | — | — | 37.3 | 24.3 | — | — | — | |
| SPARVenue=NIPS’25, Input Modalities=Images + camera poses, Supervision bboxes=true, Supervision texts=true2026.02 | — | — | 12.4 | — | — | — | — | 31.9 | |
| VG LLMVenue=NIPS’25, Input Modalities=Images, Supervision bboxes=true, Supervision texts=true2026.02 | — | — | 14.9 | — | — | — | — | 41.6 | |
| Video-3D LLM (MC)3D Generalist=true, sampling strategy=maximum coverage, frames=32, coverage ratio=95%2024.11 | — | — | — | 57.9 | 51.2 | — | — | — | |
| Video-3D LLM (Uniform)3D Generalist=true, sampling strategy=uniform sampling, frames=322024.11 | — | — | — | 58.1 | 51.7 | — | — | — | |
| ViL3DRel3D Generalist=false2024.11 | — | — | — | 47.9 | 37.7 | — | — | — |