3D Visual Grounding on ScanRefer (test)
59.98Accuracy@0.25Ground3D-LMM
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Ground3D-LMMVenue=-, Modality=3D+2D2026.07 | 59.98 | — | — | — | — | — | — | — | — | — | 36.37 | 41.3 | |
| Video-3D LLM3D Scene Input=true2026.03 | 58.1 | — | — | — | — | — | — | — | — | — | 51.7 | — | |
| VG LLM-8B3D Scene Input=false, Proposal Refinement=true2026.03 | 57.6 | — | — | — | — | — | — | — | — | — | 50.9 | — | |
| Ground3D-LMMVenue=-, Modality=3D2026.07 | 55.73 | — | — | — | — | — | — | — | — | — | 32.71 | 38.72 | |
| ChatScene3D Scene Input=true2026.03 | 55.5 | — | — | — | — | — | — | — | — | — | 50.2 | — | |
| 3D-RFT-4B3D Scene Input=false, Proposal Refinement=true2026.03 | 54.6 | — | — | — | — | — | — | — | — | — | 48.1 | — | |
| LLaVA-3D3D Scene Input=true2026.03 | 54.1 | — | — | — | — | — | — | — | — | — | 42.4 | — | |
| VG LLM-4B3D Scene Input=false, Proposal Refinement=true2026.03 | 53.5 | — | — | — | — | — | — | — | — | — | 47.5 | — | |
| SPAR3D Scene Input=false, Proposal Refinement=true2026.03 | 48.8 | — | — | — | — | — | — | — | — | — | 43.1 | — | |
| ViL3DRel3D Scene Input=true2026.03 | 47.9 | — | — | — | — | — | — | — | — | — | 37.7 | — | |
| Grounded 3D-LLM3D Scene Input=true2026.03 | 47.9 | — | — | — | — | — | — | — | — | — | 44.1 | — | |
| 3D-RFT-4B3D Scene Input=false, Proposal Refinement=false2026.03 | 42.9 | — | — | — | — | — | — | — | — | — | 15.9 | — | |
| VG LLM-8B3D Scene Input=false, Proposal Refinement=false2026.03 | 41.6 | — | — | — | — | — | — | — | — | — | 14.9 | — | |
| MVT3D Scene Input=true2026.03 | 40.8 | — | — | — | — | — | — | — | — | — | 33.3 | — | |
| ScanRefer3D Scene Input=true2026.03 | 37.3 | — | — | — | — | — | — | — | — | — | 24.3 | — | |
| VG LLM-4B3D Scene Input=false, Proposal Refinement=false2026.03 | 36.4 | — | — | — | — | — | — | — | — | — | 11.8 | — | |
| Chat-3D v23D Scene Input=true2026.03 | 35.9 | — | — | — | — | — | — | — | — | — | 30.4 | — | |
| MLLM-For3D + VideoLISAVenue=NeurIPS’25, Modality=3D+2D2026.07 | 33.12 | — | — | — | — | — | — | — | — | — | 31.21 | 30.45 | |
| SPAR3D Scene Input=false, Proposal Refinement=false2026.03 | 31.9 | — | — | — | — | — | — | — | — | — | 12.4 | — | |
| MLLM-For3D + LISA-7BVenue=NeurIPS’25, Modality=3D+2D2026.07 | 31.88 | — | — | — | — | — | — | — | — | — | 29.9 | 28.1 | |
| 3D-LLM3D Scene Input=true2026.03 | 30.3 | — | — | — | — | — | — | — | — | — | — | — | |
| IntentNetVenue=ICLR’25, Modality=3D2026.07 | 28.12 | — | — | — | — | — | — | — | — | — | 22.63 | 18.92 | |
| EDAVenue=CVPR’23, Modality=3D2026.07 | 26.5 | — | — | — | — | — | — | — | — | — | 21.2 | — | |
| M3DRef-CLIPVenue=ICCV’23, Modality=3D2026.07 | 18.3 | — | — | — | — | — | — | — | — | — | 14.8 | 10.29 | |
| Reason3DVenue=3DV’25, Modality=3D2026.07 | 17.64 | — | — | — | — | — | — | — | — | — | 13.11 | 13.05 | |
| InstanceReferVenue=ICCV’21, Modality=3D2026.07 | 13.92 | — | — | — | — | — | — | — | — | — | 11.47 | — | |
| BUTD-DETRVenue=ECCV’22, Modality=3D2026.07 | 11.99 | — | — | — | — | — | — | — | — | — | 8.95 | — | |
| TGNNVenue=AAAI’21, Modality=3D2026.07 | 11.64 | — | — | — | — | — | — | — | — | — | 9.51 | 8.13 | |
| ScanReferVenue=ECCV’20, Modality=3D2026.07 | 10.51 | — | — | — | — | — | — | — | — | — | 6.2 | — | |
| 3D-SPS3D object detection module=Jointly optimizing (Opt.)2023.08 | — | 84.1 | 66.7 | 40.3 | 29.8 | 48.8 | 37 | — | — | — | — | — | |
| 3D-VisTA3D object detection module=PointGroup (PG), pre-training=full2023.08 | — | 77 | 67.9 | 37.9 | 30.4 | 45.2 | 37.3 | — | — | — | — | — | |
| 3D-VisTA3D object detection module=Mask3D (M3D), pre-training=full2023.08 | — | 81.6 | 75.1 | 43.7 | 39.1 | 50.6 | 45.8 | — | — | — | — | — | |
| 3D-VisTA2024.05 | — | — | — | — | — | — | — | 75.1 | 39.1 | 45.8 | — | — | |
| 3D-VisTATraining Regime=Multi Dataset2025.12 | — | — | — | — | — | — | — | 81.6 | 43.7 | — | — | — | |
| 3D-VisTATrained=ScanScribe, Box Source=Mask3D predicted boxes2026.06 | — | 46.1 | 43.6 | 20.3 | 18.4 | 25.3 | 23.3 | — | — | — | — | — | |
| 3D-VisTA (scr.)Training Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 77.4 | 38.7 | — | — | — | |
| 3D-VisTA (scratch)3D object detection module=PointGroup (PG), pre-training=none2023.08 | — | 76 | 66.9 | 33.3 | 27 | 41.2 | 34.4 | — | — | — | — | — | |
| 3D-VisTA (scratch)3D object detection module=Mask3D (M3D), pre-training=none2023.08 | — | 77.4 | 70.9 | 38.7 | 34.8 | 45.9 | 41.5 | — | — | — | — | — | |
| 3DJCG3D object detection module=Jointly optimizing (Opt.)2023.08 | — | 83.5 | 64.3 | 41.4 | 30.8 | 49.6 | 37.3 | — | — | — | — | — | |
| 3DJCG2024.05 | — | — | — | — | — | — | — | 64.3 | 30.8 | 37.3 | — | — | |
| 3DVG-Trans3D object detection module=Jointly optimizing (Opt.)2023.08 | — | 81.9 | 60.6 | 39.3 | 28.4 | 47.6 | 34.7 | — | — | — | — | — | |
| BUTD-DETRTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 84.2 | 46.6 | — | — | — | |
| Chat-SceneTraining Regime=Multi Dataset2025.12 | — | — | — | — | — | — | — | 89.6 | 47.8 | — | — | — | |
| ConcreteNet2024.10 | — | — | 69.3 | — | 37.6 | — | 44.7 | — | — | — | — | — | |
| D-LISA2024.10 | — | — | 69 | — | 39.7 | — | 46.3 | — | — | — | — | — | |
| GPSTrained=SceneVerse, Box Source=Mask3D predicted boxes2026.06 | — | 50.1 | 46.8 | 19.9 | 17.7 | 25.8 | 23.4 | — | — | — | — | — | |
| LIBATraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 88.8 | 54.4 | — | — | — | |
| LLaVA-3DTraining Regime=Multi Dataset2025.12 | — | — | — | — | — | — | — | — | — | — | — | — | |
| M3DRef-CLIP2024.05 | — | — | — | — | — | — | — | 77.2 | 36.8 | 44.7 | — | — | |
| MCLNTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 86.9 | 52 | — | — | — | |
| MVT3D object detection module=PointGroup (PG)2023.08 | — | 77.7 | 66.5 | 31.9 | 25.3 | 40.8 | 33.3 | — | — | — | — | — | |
| PanoGrounderTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 84.3 | 55.3 | — | — | — | |
| PanoGrounderTraining Regime=Multi Dataset (ScanRefer + ReferIt3D)2025.12 | — | — | — | — | — | — | — | 85 | 56.4 | — | — | — | |
| PQ3DTraining setup=single dataset2024.05 | — | — | — | — | — | — | — | 76.6 | 42 | 47.4 | — | — | |
| PQ3DTraining setup=joint training2024.05 | — | — | — | — | — | — | — | 78.2 | 46.2 | 51.2 | — | — | |
| PQ3DTraining Regime=Multi Dataset2025.12 | — | — | — | — | — | — | — | 86.7 | 51.5 | — | — | — | |
| PQ3D (sg.)Training Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 85.2 | 46.8 | — | — | — | |
| SAT3D object detection module=VoteNet (VN)2023.08 | — | 73.2 | 50.8 | 37.6 | 25.2 | 44.5 | 30.1 | — | — | — | — | — | |
| TSP3DTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 87.3 | 51 | — | — | — | |
| UniSeg3DVenue=NeurIPS’24, Modality=3D2026.07 | — | — | — | — | — | — | — | — | — | — | — | 29.1 | |
| UniT3D2024.05 | — | — | — | — | — | — | — | 73.1 | 31.1 | 39.1 | — | — | |
| UniVLGTraining Regime=Multi Dataset2025.12 | — | — | — | — | — | — | — | — | — | — | — | — | |
| V3DMTrained=ViGiL3D++, Box Source=Mask3D predicted boxes2026.06 | — | 44 | 41.3 | 17.4 | 15.6 | 22.5 | 20.6 | — | — | — | — | — | |
| V3DMTrained=ViGiL3D++SR, Box Source=Mask3D predicted boxes2026.06 | — | 48 | 45.3 | 22.8 | 20.8 | 27.7 | 25.5 | — | — | — | — | — | |
| VGMambaTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 91.9 | 54.8 | — | — | — | |
| ViewSRDTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 82.1 | 37.4 | — | — | — | |
| ViL3DRel3D object detection module=PointGroup (PG)2023.08 | — | 81.6 | 68.6 | 40.3 | 30.7 | 47.9 | 37.7 | — | — | — | — | — | |
| ViL3DRel2024.05 | — | — | — | — | — | — | — | 68.6 | 30.7 | 37.7 | — | — | |
| ViL3DRelTraining Regime=Single Dataset2025.12 | — | — | — | — | — | — | — | 81.6 | 40.3 | — | — | — |