3D Visual Grounding on ScanRefer (val)
66.83Overall Accuracy @ IoU 0.50InstanceRefer
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| InstanceRefer2022.04 | 66.83 | 77.45 | — | — | — | — | — | — | — | — | — | — | |
| Multi-View Transformerview num=42022.04 | 66.45 | 77.67 | — | — | — | — | — | — | — | — | — | — | |
| Multi-View Transformerview num=12022.04 | 63.04 | 74.36 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3DModel Type=Two-Stage 3D LMMs, Protocol=Two-stage application2024.09 | 58.6 | 63.9 | — | — | — | — | — | — | — | — | — | — | |
| GPT4SceneVenue=ICLR’26, Zero-Shot=false, Agent=Qwen2-VL-7B2026.05 | 57 | 62.6 | 90.3 | 83.7 | 56.4 | 50.9 | — | — | — | — | — | — | |
| TGNN + BERT2022.04 | 56.8 | 68.61 | — | — | — | — | — | — | — | — | — | — | |
| CVPMethod Category=3D LMMs2025.12 | 55.4 | 62 | — | — | — | — | — | — | — | — | — | — | |
| 3D-IDE2026.03 | 54.53 | 60.94 | 86.72 | 77.94 | 54.73 | 48.9 | — | — | — | — | — | — | |
| MCM-VGModality=3D+2D, Supervision=Zero-Shot2026.04 | 53.6 | 62 | 81.8 | 74.2 | 54.9 | 46.2 | — | — | — | — | — | — | |
| APEIRIAOutput=Text, modular inference enhancement=true2026.05 | 53.2 | 60.5 | — | — | — | — | — | — | — | — | — | — | |
| TGNN2022.04 | 53.01 | 64.5 | — | — | — | — | — | — | — | — | — | — | |
| Video-3D-LLMMethod Category=3D LMMs2025.12 | 51.7 | 58.1 | — | — | — | — | — | — | — | — | — | — | |
| Video-3D LLM2026.03 | 51.7 | 58.1 | 88 | 78.3 | 50.9 | 45.3 | — | — | — | — | — | — | |
| Video-3D LLMVenue=CVPR’25, Zero-Shot=false, Agent=LLaVA-Video 7B2026.05 | 51.7 | 58.1 | 88 | 78.3 | 50.9 | 45.3 | — | — | — | — | — | — | |
| Video-3D LLMOutput=Head, modular inference enhancement=false2026.05 | 51.7 | 58.1 | — | — | — | — | — | — | — | — | — | — | |
| Inst3D-LMMMethod Paradigm=Generalist2025.03 | 51.6 | 57.8 | 88.6 | 81.5 | 48.7 | 43.2 | — | — | — | — | — | — | |
| Inst3D-LMMOutput=Text, modular inference enhancement=false2026.05 | 51.6 | 57.8 | — | — | — | — | — | — | — | — | — | — | |
| PQ3D2026.03 | 51.2 | 57 | 86.7 | 78.3 | 51.5 | 46.2 | — | — | — | — | — | — | |
| PQ3DOutput=Head, modular inference enhancement=false2026.05 | 51.2 | 57 | — | — | — | — | — | — | — | — | — | — | |
| APEIRIAOutput=Text, modular inference enhancement=false2026.05 | 51.2 | 58.4 | — | — | — | — | — | — | — | — | — | — | |
| 3DRS*2026.03 | 50.83 | 56.95 | 82.76 | 73.5 | 50.74 | 45.37 | — | — | — | — | — | — | |
| Chat-Scene2023.12 | 50.23 | 55.52 | 89.59 | 82.49 | 47.78 | 42.9 | — | — | — | — | — | — | |
| Chat-SceneMethod Paradigm=Generalist2025.03 | 50.2 | 55.5 | — | — | — | — | — | — | — | — | — | — | |
| Chat-SceneModel Type=Two-Stage 3D LMMs2024.09 | 50.2 | 55.5 | — | — | — | — | — | — | — | — | — | — | |
| Chat-Scene2025.12 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-SceneMethod Category=3D LMMs2025.12 | 50.2 | 55.5 | — | — | — | — | — | — | — | — | — | — | |
| ChatScene2026.03 | 50.2 | 55.5 | 89.6 | 82.5 | 47.8 | 42.9 | — | — | — | — | — | — | |
| Chat-SceneVenue=NIPS’24, Zero-Shot=false, Agent=Vicuna-7B2026.05 | 50.2 | 55.5 | 89.6 | 82.5 | 47.8 | 42.9 | — | — | — | — | — | — | |
| Chat-SceneOutput=Text, modular inference enhancement=false2026.05 | 50.2 | 55.5 | — | — | — | — | — | — | — | — | — | — | |
| SeqVLMVenue=ACM’25, Agent Rep.=✗, Agent VLM=Doubao-1.5, Prior Info. Bbox=✓, Prior Info. Class=✓, Paradigm=Open-Vocabulary Zero-Shot2026.03 | 49.6 | 55.6 | — | — | — | — | — | — | — | — | — | — | |
| SeqVLMModality=3D+2D, Supervision=Zero-Shot2026.04 | 49.6 | 55.6 | 77.3 | 72.7 | 47.8 | 41.3 | — | — | — | — | — | — | |
| ConcreteNetMethod Paradigm=Closed-set, full sup.2025.03 | 49.5 | 56.1 | 86.1 | 79.2 | 47.5 | 40.9 | — | — | — | — | — | — | |
| SPAZERVenue=NeurIPS’25, Agent Rep.=✗, Agent VLM=GPT-4o, Prior Info. Bbox=✓, Prior Info. Class=✓, Paradigm=Open-Vocabulary Zero-Shot2026.03 | 48.8 | 57.2 | — | — | — | — | — | — | — | — | — | — | |
| GPS2025.12 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | |
| SceneVerseOutput=Head, modular inference enhancement=false2026.05 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Lemontraining=fine-tuned2025.12 | 48 | — | — | — | — | — | — | — | — | — | — | — | |
| D-LISA2024.10 | 46.9 | — | — | 75.5 | — | 40 | — | — | — | — | — | — | |
| TSP3DInput=3D, Stage=Single-stage2025.02 | 46.71 | 56.45 | — | — | — | — | — | — | 12.43 | — | — | — | |
| TSP3DVenue=CVPR’25, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 46.7 | 56.5 | — | — | — | — | — | — | — | — | — | — | |
| baseline2026.03 | 46.66 | 52.29 | 82.17 | 73.71 | 45.1 | 40.14 | — | — | — | — | — | — | |
| ConcreteNetVenue=ECCV242023.12 | 46.53 | 50.61 | 86.4 | 82.05 | 42.41 | 38.39 | — | — | — | — | — | — | |
| ConcreteNetFine-tuned on Training Set=true, Source=ECCV’242026.01 | 46.5 | 50.6 | 86.4 | 82.1 | 42.4 | 38.4 | — | — | — | — | — | — | |
| ConcreteNetSupervision Level=Fully-Supervised, Venue=ECCV’24, Agent=—2025.12 | 46.5 | 50.6 | — | — | — | — | — | — | — | — | — | — | |
| ConcreteNetVenue=ECCV’24, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 46.5 | 50.6 | — | — | — | — | — | — | — | — | — | — | |
| ConcreteNetVenue=ECCV’24, Zero-Shot=false, Agent=-2026.05 | 46.5 | 50.6 | 86.4 | 82.1 | 42.4 | 38.4 | — | — | — | — | — | — | |
| 3D-VisTAw/o. LLM/VLM=true, w/o. PC=false, Zero-Shot=false2026.07 | 46.2 | 51 | — | — | — | — | — | — | — | — | — | — | |
| 3D-VisTAVenue=ICCV232023.12 | 45.8 | 50.6 | 81.6 | 75.1 | 43.7 | 39.1 | — | — | — | — | — | — | |
| 3D-VisTAFine-tuned on Training Set=true, Source=ICCV’232026.01 | 45.8 | 50.6 | 81.6 | 75.1 | 43.7 | 39.1 | — | — | — | — | — | — | |
| 3D-VisTA2025.12 | 45.8 | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-VisTASupervision Level=Fully-Supervised, Venue=ICCV’23, Agent=—2025.12 | 45.8 | 50.6 | — | — | — | — | — | — | — | — | — | — | |
| 3D-VisTAVenue=ICCV’23, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 45.8 | 50.6 | — | — | — | — | — | — | — | — | — | — | |
| 3D-VisTA2026.03 | 45.8 | 50.6 | 81.6 | 75.1 | 43.7 | 39.1 | — | — | — | — | — | — | |
| 3D-VisTAGT Pointcloud=YES, Supervision=Full2026.05 | 45.8 | 50.6 | 81.6 | 75.1 | 43.7 | 39.1 | — | — | — | — | — | — | |
| 3D-VisTAOutput=Head, modular inference enhancement=false2026.05 | 45.8 | 50.6 | — | — | — | — | — | — | — | — | — | — | |
| MCLNFine-tuned on Training Set=true, Source=ECCV’242026.01 | 45.7 | 57.2 | 86.9 | 72.7 | 52 | 40.8 | — | — | — | — | — | — | |
| MCLNSupervision Level=Fully-Supervised, Venue=ECCV’24, Agent=—2025.12 | 45.7 | 57.2 | — | — | — | — | — | — | — | — | — | — | |
| MCLNVenue=ECCV’24, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 45.7 | 57.2 | — | — | — | — | — | — | — | — | — | — | |
| MCLNGT Pointcloud=YES, Supervision=Full2026.05 | 45.7 | 57.2 | 86.9 | 72.7 | 52 | 40.8 | — | — | — | — | — | — | |
| MCLNVenue=ECCV’24, Zero-Shot=false, Agent=-2026.05 | 45.7 | 57.2 | 86.9 | 72.7 | 52 | 40.8 | — | — | — | — | — | — | |
| G2TAMw/o. LLM/VLM=true, w/o. PC=true, Zero-Shot=true2026.07 | 45.7 | 56.2 | — | — | — | — | — | — | — | — | — | — | |
| G³-LQInput=3D, Stage=Two-Stage2025.02 | 45.58 | 56.9 | — | — | — | — | — | — | — | — | — | — | |
| MCLNInput=3D, Stage=Two-Stage2025.02 | 45.53 | 57.17 | — | — | — | — | — | — | 3.17 | — | — | — | |
| MCLNModality=3D, Supervision=Fully-Supervised2026.04 | 45.53 | 57.17 | 86.89 | 72.73 | 51.96 | 40.76 | — | — | — | — | — | — | |
| DOrAVenue=ArXiv242023.12 | 44.8 | 52.8 | — | — | — | — | — | — | — | — | — | — | |
| DOrA2024.10 | 44.8 | — | — | — | — | — | — | — | — | — | — | — | |
| G³-LQInput=3D, Stage=Single-stage2025.02 | 44.72 | 55.95 | — | — | — | — | — | — | — | — | — | — | |
| M3DRef-CLIPMethod Paradigm=Closed-set, full sup.2025.03 | 44.7 | 51.9 | 77.2 | — | 36.8 | — | — | — | — | — | — | — | |
| M3DRef-CLIPVenue=ICCV232023.12 | 44.7 | 51.9 | 85.3 | 77.2 | 43.8 | 36.8 | — | — | — | — | — | — | |
| M3DRef-CLIPModel Type=Task-specific2024.09 | 44.7 | 51 | — | — | — | — | — | — | — | — | — | — | |
| G3-LQFine-tuned on Training Set=true, Source=CVPR’242026.01 | 44.7 | 56 | 88.6 | 73.3 | 50.2 | 39.7 | — | — | — | — | — | — | |
| G3-LQSupervision Level=Fully-Supervised, Venue=CVPR’24, Agent=—2025.12 | 44.7 | 56 | — | — | — | — | — | — | — | — | — | — | |
| M3DRef-CLIPMethod Category=Expert models2025.12 | 44.7 | 51 | — | — | — | — | — | — | — | — | — | — | |
| G3-LQVenue=CVPR’24, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 44.7 | 56 | — | — | — | — | — | — | — | — | — | — | |
| M3DRef-CLIP2026.03 | 44.7 | 51.9 | 85.3 | 77.2 | 43.8 | 36.8 | — | — | — | — | — | — | |
| G3-LQGT Pointcloud=YES, Supervision=Full2026.05 | 44.7 | 56 | 88.6 | 73.3 | 50.2 | 39.7 | — | — | — | — | — | — | |
| G3-LQVenue=CVPR’24, Zero-Shot=false, Agent=-2026.05 | 44.7 | 56 | 88.6 | 73.3 | 50.2 | 39.7 | — | — | — | — | — | — | |
| M3DRef-CLIPOutput=Head, modular inference enhancement=false2026.05 | 44.7 | 51.9 | — | — | — | — | — | — | — | — | — | — | |
| Grounded 3D-LLMMethod Paradigm=Generalist2025.03 | 44.1 | 47.9 | — | — | — | — | — | — | — | — | — | — | |
| Grounded 3D-LLMModel Type=Two-Stage 3D LMMs2024.09 | 44.1 | 47.9 | — | — | — | — | — | — | — | — | — | — | |
| Grounded 3D-LLMMethod Category=3D LMMs2025.12 | 44.1 | 47.9 | — | — | — | — | — | — | — | — | — | — | |
| Grounded 3D-LLM2026.03 | 44.1 | 47.9 | — | — | — | — | — | — | — | — | — | — | |
| Grounded 3D-LLMOutput=Head, modular inference enhancement=false2026.05 | 44 | 48.6 | — | — | — | — | — | — | — | — | — | — | |
| CORE-3DVGMethod Paradigm=Closed-set, full sup.2025.03 | 43.8 | 56.8 | 85 | 67.1 | 51.8 | 39.8 | — | — | — | — | — | — | |
| ConcreteNet2024.10 | 43.8 | — | — | 75.6 | — | 36.6 | — | — | — | — | — | — | |
| ScanRefer2022.04 | 43.31 | 65 | — | — | — | — | — | — | — | — | — | — | |
| VPP-NetInput=3D, Stage=Two-Stage2025.02 | 43.29 | 55.65 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3DMethod Category=3D LMMs2025.12 | 42.7 | 50.1 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3DOutput=Head, modular inference enhancement=false2026.05 | 42.7 | 50.1 | — | — | — | — | — | — | — | — | — | — | |
| MCLNInput=3D, Stage=Single-stage2025.02 | 42.64 | 54.3 | — | — | — | — | — | — | 5.45 | — | — | — | |
| EDAFine-tuned on Training Set=true, Source=CVPR’232026.01 | 42.3 | 54.6 | 85.8 | 68.6 | 49.1 | 37.6 | — | — | — | — | — | — | |
| EDASupervision Level=Fully-Supervised, Venue=CVPR’23, Agent=—2025.12 | 42.3 | 54.6 | — | — | — | — | — | — | — | — | — | — | |
| EDAVenue=CVPR’23, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 42.3 | 54.6 | — | — | — | — | — | — | — | — | — | — | |
| EDAGT Pointcloud=YES, Supervision=Full2026.05 | 42.3 | 54.6 | 85.8 | 68.6 | 49.1 | 37.6 | — | — | — | — | — | — | |
| EDAVenue=CVPR232023.12 | 42.26 | 54.59 | 85.76 | 68.57 | 49.13 | 37.64 | — | — | — | — | — | — | |
| EDAInput=3D, Stage=Two-Stage2025.02 | 42.26 | 54.59 | — | — | — | — | — | — | 3.34 | — | — | — | |
| EDAModality=3D, Supervision=Fully-Supervised2026.04 | 42.26 | 54.59 | 85.76 | 68.57 | 49.13 | 37.64 | — | — | — | — | — | — | |
| LLaVA-3D2026.03 | 42.2 | 54.1 | — | — | — | — | — | — | — | — | — | — | |
| AgentGrounderZero-Shot=true, Agent=Qwen3-VL-32B2026.05 | 41.9 | 47.2 | 80.3 | 73.7 | 36.6 | 31.7 | — | — | — | — | — | — | |
| EDAInput=3D, Stage=Single-stage2025.02 | 41.7 | 53.83 | — | — | — | — | — | — | 5.98 | — | — | — | |
| 3D-VisTAfrom_scratch=true2024.10 | 41.5 | — | — | 70.9 | — | 34.8 | — | — | — | — | — | — |