3D Visual Grounding on ScanRefer
66Acc@0.25VLM-Grounder
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| VLM-GrounderSupervision=Zero-Shot, VLM=GPT-4o, notes=results on selected 250 samples2025.12 | 66 | — | — | — | — | — | — | 29.8 | — | |
| Vid-LLMModel Category=Video-based models2025.09 | 63.2 | — | — | — | — | — | — | 56.4 | — | |
| 3DRSModel Category=3D-based models2025.09 | 62.9 | — | — | — | — | — | — | 56.1 | — | |
| 3DRSModel category=Generalists, 3D geometric inputs=Yes2026.03 | 62.9 | — | — | — | — | — | — | 56.1 | — | |
| GPT4Scene-HDMInput 2D=true, Input 3D=true2026.03 | 62.6 | — | — | — | — | — | — | 57 | — | |
| Motion-MLLM-4BInput 2D=true, Input M (egomotion)=true2026.03 | 61.4 | — | — | — | — | — | — | 55.3 | — | |
| 3D-IDEModel category=Generalists, 3D geometric inputs=No2026.03 | 60.9 | — | — | — | — | — | — | 54.5 | — | |
| GUIDE-9B3D Input=false, Proposal Refinement=true2026.04 | 59.6 | — | — | — | — | — | — | 53.1 | — | |
| CAIRNLLM=Qwen3-8B2026.07 | 59.6 | — | — | — | — | — | — | 54.1 | — | |
| Inst3D-LMMLLM=Qwen3-8B2026.07 | 58.9 | — | — | — | — | — | — | 52.7 | — | |
| Stream3D-VLM-8BOnline=true2026.06 | 58.4 | — | — | — | — | — | — | 52.5 | — | |
| 3DGraphLLMLLM=Qwen3-8B2026.07 | 58.4 | — | — | — | — | — | — | 53.1 | — | |
| 3DGraphLLM-1B + QuatRoPEDetector / Segmentation=GT2026.03 | 58.3 | — | — | 50.8 | 50.6 | — | — | 58.2 | — | |
| 3DGraphLLM-7B + QuatRoPEDetector / Segmentation=Mask3D2026.03 | 58.2 | — | — | 54.3 | 49.2 | — | — | 52.5 | — | |
| Video-3D LLMModel Category=3D-based models2025.09 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLMinfused with 3D information=true2025.08 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLM3D Input=true2026.03 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLMInput 2D=true, Input 3D=true2026.03 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLMModel category=Generalists, 3D geometric inputs=Yes2026.03 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLM(Uniform)3D Input=true2026.04 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| Video-3D LLMOnline=false2026.06 | 58.1 | — | — | — | — | — | — | 51.7 | — | |
| OpenGroundSupervision=Zero-Shot, VLM=GLM-4.5V2025.12 | 57.9 | — | — | — | — | — | — | 47.9 | — | |
| MA2TransVGDetector / Segmentation=Group-free2026.03 | 57.9 | — | — | 53.8 | 41.4 | — | — | 45.7 | — | |
| Video-3D LLM(MC)3D Input=true2026.04 | 57.9 | — | — | — | — | — | — | 51.2 | — | |
| Chat-Scene-7B + QuatRoPEDetector / Segmentation=Mask3D2026.03 | 57.8 | — | — | 51.1 | 45.7 | — | — | 52.2 | — | |
| Inst3D-LLMModel category=Generalists, 3D geometric inputs=Yes2026.03 | 57.8 | — | — | — | — | — | — | 51.6 | — | |
| Inst3D-LMMOnline=false2026.06 | 57.8 | — | — | — | — | — | — | 51.6 | — | |
| Inst3D-LMMLLM=Vicuna-7B-v1.52026.07 | 57.8 | — | — | — | — | — | — | 51.6 | — | |
| VG LLM-8BInput 2D=true, Proposal refinement=true2026.03 | 57.6 | — | — | — | — | — | — | 50.9 | — | |
| VG LLM-8BModel category=Generalists, 3D geometric inputs=No2026.03 | 57.6 | — | — | — | — | — | — | 50.9 | — | |
| VG LLM-8B3D Input=false, Proposal Refinement=true2026.04 | 57.6 | — | — | — | — | — | — | 50.9 | — | |
| Chat-SceneLLM=Qwen3-8B2026.07 | 57.5 | — | — | — | — | — | — | 51.9 | — | |
| 3DGraphLLM-7BDetector / Segmentation=Mask3D2026.03 | 57 | — | — | — | — | — | — | 51.3 | — | |
| PQ3DModel category=Generalists, 3D geometric inputs=Yes2026.03 | 57 | — | — | — | — | — | — | 51.2 | — | |
| DVTIEPruning Ratio=35%2026.04 | 56.91 | — | — | — | — | — | — | 51.42 | — | |
| DVTIEPruning Ratio=65%2026.04 | 56.67 | — | — | — | — | — | — | 51 | — | |
| Fast3DPruning Ratio=35%2026.04 | 56.61 | — | — | — | — | — | — | 51.02 | — | |
| TSP3DDetector / Segmentation=N/A2026.03 | 56.5 | — | — | — | — | — | — | 46.7 | — | |
| Stream3D-VLM-4BOnline=true2026.06 | 56.5 | — | — | — | — | — | — | 51.9 | — | |
| Fast3DPruning Ratio=65%2026.04 | 56.47 | — | — | — | — | — | — | 50.79 | — | |
| GPT4SceneSupervision=Supervised, VLM=None2025.12 | 56.4 | — | — | — | — | — | — | 50.9 | — | |
| Baseline (Chat-Scene)Pruning Ratio=0%2026.04 | 56.21 | — | — | — | — | — | — | 50.42 | — | |
| DVTIEPruning Ratio=90%2026.04 | 56.17 | — | — | — | — | — | — | 51.35 | — | |
| Fast3DPruning Ratio=90%2026.04 | 56.09 | — | — | — | — | — | — | 50.93 | — | |
| 3DGraphLLM-1BDetector / Segmentation=GT2026.03 | 55.9 | — | — | 47.9 | 47.7 | — | — | 55.8 | — | |
| VPP-NetDetector / Segmentation=Group-free2026.03 | 55.7 | — | — | 50.3 | 39 | — | — | 43.3 | — | |
| AugReferDetector / Segmentation=Group-free2026.03 | 55.7 | — | — | 50 | 39.1 | — | — | 44 | — | |
| Chat-SceneModel Category=LLM-based Models2023.12 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| ChatSceneModel Category=3D LLMs2026.02 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| ChatSceneModel Category=3D-based models2025.09 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| ChatScene3D Input=true2026.03 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| Chat-SceneInput 2D=true, Input 3D=true2026.03 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| Chat-Scene-7BDetector / Segmentation=Mask3D2026.03 | 55.5 | — | — | 47.8 | 42.9 | — | — | 50.2 | — | |
| ChatSceneModel category=Generalists, 3D geometric inputs=Yes2026.03 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| ChatScene3D Input=true2026.04 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| Chat-SceneLLM=Vicuna-7B-v1.52026.07 | 55.5 | — | — | — | — | — | — | 50.2 | — | |
| Chat-Scene-1B + QuatRoPEDetector / Segmentation=GT2026.03 | 55.4 | — | — | 47.8 | 47.4 | — | — | 55 | — | |
| FastVPruning Ratio=35%2026.04 | 55.4 | — | — | — | — | — | — | 49.86 | — | |
| 3DRSModel Category=Video-based models, 3D Geometry Source=VGGT-generated2025.09 | 55.2 | — | — | — | — | — | — | 51.1 | — | |
| VG LLM-8BOnline=false2026.06 | 54.4 | — | — | — | — | — | — | 47.9 | — | |
| LLaVA-3Dinfused with 3D information=true2025.08 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| LLaVA-3D3D Input=true2026.03 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| LLaVA-3DInput 2D=true, Input 3D=true2026.03 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| LLaVA-3DModel category=Generalists, 3D geometric inputs=Yes2026.03 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| LLaVA-3D3D Input=true2026.04 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| LLaVA-3DOnline=false2026.06 | 54.1 | — | — | — | — | — | — | 42.4 | — | |
| Video-3D LLM*Model category=Generalists, 3D geometric inputs=No2026.03 | 53.7 | — | — | — | — | — | — | 47.8 | — | |
| VGLLMModel Category=Video-based models2025.09 | 53.5 | — | — | — | — | — | — | 47.5 | — | |
| VG LLM-4BInput 2D=true, Proposal refinement=true2026.03 | 53.5 | — | — | — | — | — | — | 47.5 | — | |
| VG LLM-4BModel category=Generalists, 3D geometric inputs=No2026.03 | 53.5 | — | — | — | — | — | — | 47.5 | — | |
| VG LLM-4B3D Input=false, Proposal Refinement=true2026.04 | 53.5 | — | — | — | — | — | — | 47.5 | — | |
| GAP-MLLM-3B3D Input=false2026.03 | 53.1 | — | — | — | — | — | — | 26 | — | |
| ThinkGraphs2026.06 | 52.9 | — | — | — | — | — | — | 37.6 | — | |
| 3DSynDetector / Segmentation=Mask3D2026.03 | 52.3 | — | — | — | — | — | — | 46.2 | — | |
| M3DRef-CLIPModel Category=Expert Models2023.12 | 51.9 | — | — | — | — | — | — | 44.7 | — | |
| M3DRef-CLIPModel category=Specialists2026.03 | 51.9 | — | — | — | — | — | — | 44.7 | — | |
| M3DRef-CLIPLLM=None2026.07 | 51.9 | — | — | — | — | — | — | 44.7 | — | |
| SPAZERSupervision=Zero-Shot, VLM=GPT-4o2025.12 | 51.7 | — | — | — | — | — | — | 43.4 | — | |
| 3D-VLPModel Category=Expert Models2023.12 | 51.4 | — | — | — | — | — | — | 39.5 | — | |
| 3D-VLPLLM=None2026.07 | 51.4 | — | — | — | — | — | — | 39.5 | — | |
| 3D-LLaVAModel category=Generalists, 3D geometric inputs=Yes2026.03 | 51.2 | — | — | — | — | — | — | 40.6 | — | |
| GPT4Scene-HDLLM=Qwen2-VL-7B2026.07 | 50.9 | — | — | — | — | — | — | 46.4 | — | |
| Chat-Scene-1BDetector / Segmentation=GT2026.03 | 50.7 | — | — | 42.7 | 42.3 | — | — | 50.3 | — | |
| 3D-VisTAModel Category=Expert Models2023.12 | 50.6 | — | — | — | — | — | — | 45.5 | — | |
| ConcreteNetModel Category=Expert Models2023.12 | 50.6 | — | — | — | — | — | — | 46.5 | — | |
| 3D-VisTAInput 3D=true2026.03 | 50.6 | — | — | — | — | — | — | 45.8 | — | |
| 3D-VisTADetector / Segmentation=Mask3D2026.03 | 50.6 | — | — | 43.7 | 39.1 | — | — | 45.8 | — | |
| 3D-VisTAModel category=Specialists2026.03 | 50.6 | — | — | — | — | — | — | 45.8 | — | |
| 3D-VistaOnline=false2026.06 | 50.6 | — | — | — | — | — | — | 45.8 | — | |
| 3D-VisTALLM=None2026.07 | 50.6 | — | — | — | — | — | — | 45.8 | — | |
| C2RoPEModel Category=Ours2026.02 | 50.5 | — | — | — | — | — | — | 42.9 | — | |
| ToMePruning Ratio=35%2026.04 | 50.43 | — | — | — | — | — | — | 45.39 | — | |
| LLaVA-3DModel Category=3D LLMs2026.02 | 50.1 | — | — | — | — | — | — | 42.7 | — | |
| LLaVA-3DModel Category=3D-based models2025.09 | 50.1 | — | — | — | — | — | — | 42.7 | — | |
| VID-LLMModel category=Generalists, 3D geometric inputs=No2026.03 | 50.1 | — | — | — | — | — | — | 46.7 | — | |
| VG-LLM-4B (w/ GAP)3D Input=false2026.03 | 49.7 | — | — | — | — | — | — | 23.2 | — | |
| 3DJCGModel Category=Expert Models2023.12 | 49.6 | — | — | — | — | — | — | 37.3 | — | |
| 3DJCGDetector / Segmentation=VoteNet2026.03 | 49.6 | — | — | 41.4 | 30.8 | — | — | 37.3 | — | |
| Spatial-MLLM-4BOnline=false2026.06 | 49.3 | — | — | — | — | — | — | 44.2 | — | |
| SPAR-7BInput 2D=true, Proposal refinement=true2026.03 | 48.8 | — | — | — | — | — | — | 43.1 | — |