3D Visual Grounding on Nr3D
75.1Overall Success RatePruneGround
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| PruneGroundVenue=Ours2026.06 | 75.1 | 84.6 | 68.8 | 71.2 | 76.6 | — | — | |
| PanoGrounderVenue=arXiv2026.06 | 74.6 | 82.2 | 67.2 | 70.5 | 76.3 | — | — | |
| ViewSRDSupervision=Supervised2025.12 | 69.9 | 75.3 | 64.8 | 68.6 | 70.6 | — | — | |
| ViewSRDVenue=ICCV2026.06 | 69.9 | 75.3 | 64.8 | 68.6 | 70.6 | — | — | |
| 3D-R1Supervision=Supervised2025.12 | 68.8 | — | — | — | — | — | — | |
| VGMambaVenue=ICCV2026.06 | 68.3 | — | 61.4 | — | — | — | — | |
| 3DRP-Net2024.10 | 65.9 | 71.4 | 59.7 | 64.2 | 65.2 | — | — | |
| Vid-LLM2025.09 | 65.4 | — | 57.9 | 61.9 | — | — | — | |
| MA2TransVGVenue=CVPR2026.06 | 65.2 | — | 57.6 | — | — | — | — | |
| SceneVerse2025.09 | 64.9 | — | 57.8 | 56.9 | — | — | — | |
| PQ3DVenue=ICCV2026.06 | 64.9 | 73.3 | 56.7 | 60.7 | 67 | — | — | |
| LIBAVenue=AAAI2026.06 | 64.5 | — | 57.2 | 60.3 | — | — | — | |
| ViL3DRelobject proposals=ground-truth2023.08 | 64.4 | 70.2 | 57.4 | 62 | 64.5 | — | — | |
| ViL3DRef2024.10 | 64.4 | 70.2 | 57.4 | 62 | 64.5 | — | — | |
| ViL3DRelType=Supervised2026.01 | 64.4 | 70.2 | 57.4 | 62 | 64.5 | — | — | |
| MiKASABackbone=Transformer, FT (Grounding-specific training or finetuning)=true2026.05 | 64.4 | 69.7 | 59.4 | 65.4 | 64 | — | — | |
| ViL3DRelVenue=NeurIPS2026.06 | 64.4 | 70.2 | 57.4 | 62 | 64.5 | — | — | |
| MIKASAVenue=CVPR2026.06 | 64.4 | 69.7 | 59.4 | 65.4 | 64 | — | — | |
| 3D-VisTAtrain from scratch=false, object proposals=ground-truth2023.08 | 64.2 | 72.1 | 56.7 | 61.5 | 65.1 | — | — | |
| 3D-VisTA2025.09 | 64.2 | — | 56.7 | 61.5 | — | — | — | |
| CoT3DRef2024.10 | 64 | 70.4 | 57.3 | 61.5 | 64.8 | — | — | |
| SPAZERSupervision=Zero-Shot, VLM=GPT-4o [37]2025.12 | 63.8 | 68 | 58.8 | 59.9 | 66.2 | — | — | |
| SPAZERBackbone=GPT-4o, FT (Grounding-specific training or finetuning)=false2026.05 | 63.8 | 68 | 58.8 | 59.9 | 66.2 | — | — | |
| Chat-3D v22025.09 | 63.6 | — | 57 | 61.1 | — | — | — | |
| ViL3DRel2025.09 | 62.6 | — | 55.6 | 59.8 | — | — | — | |
| SORT3DBackbone=LLM toolbox, FT (Grounding-specific training or finetuning)=false2026.05 | 62 | — | — | 56.6 | 64.3 | — | — | |
| OursSupervision=Zero-Shot, VLM=GLM-4.5V [51]2025.12 | 61.7 | 64.3 | 59.3 | 59.2 | 63.1 | — | — | |
| DOrA2024.10 | 59.9 | 59.7 | 66.6 | 53.1 | 59.2 | — | — | |
| ViGORBackbone=3D listener, FT (Grounding-specific training or finetuning)=true2026.05 | 59.7 | 66.6 | 53.1 | 59.2 | 59.9 | — | — | |
| MVTobject proposals=ground-truth2023.08 | 59.5 | 67.4 | 52.7 | 59.1 | 60.3 | — | — | |
| G3-LQVenue=CVPR2026.06 | 58.4 | — | 50.7 | — | — | — | — | |
| 3D-VisTAtrain from scratch=true, object proposals=ground-truth2023.08 | 57.5 | 65.9 | 49.4 | 53.7 | 59.4 | — | — | |
| 3D-VisTASetting=scratch2024.10 | 57.5 | 65.9 | 49.4 | 53.7 | 59.4 | — | — | |
| 3D-VisTAVenue=ICCV2026.06 | 57.5 | 65.9 | 49.4 | 53.7 | 59.4 | — | — | |
| SATobject proposals=ground-truth2023.08 | 56.5 | 64.9 | 48.4 | 54.4 | 57.6 | — | — | |
| MVT2024.10 | 55.4 | 61.3 | 49.1 | 54.3 | 55.4 | — | — | |
| MVT2025.09 | 55.1 | — | 49.1 | 54.3 | — | — | — | |
| BUTD-DETRSupervision=Fully supervised2023.11 | 54.6 | 60.7 | 48.4 | 46 | 58 | — | — | |
| BUTD-DETR2024.10 | 54.6 | 60.7 | 48.4 | 46 | 58 | — | — | |
| BUTD-DETRFine-tuned on Training Set=true, Source=ECCV'222026.01 | 54.6 | 60.7 | 48.4 | 46 | 58 | — | — | |
| SeqVLMSupervision=Zero-Shot, VLM=Doubao-1.5-pro [5]2025.12 | 53.2 | 58.1 | 47.4 | 51 | 54.5 | — | — | |
| D-LISA2024.10 | 53.1 | 60.2 | 46.2 | 44.3 | 57.4 | — | — | |
| LaSPBackbone=LLM program, FT (Grounding-specific training or finetuning)=false2026.05 | 52.9 | 60.7 | 45.3 | 49.2 | 54.7 | — | — | |
| VIZOR-GPTType=Zero-shot2026.01 | 52.81 | 62.52 | 43.48 | 43.02 | 57.66 | — | — | |
| 3D-SPSobject proposals=ground-truth2023.08 | 51.5 | 58.1 | 45.1 | 48 | 53.2 | — | — | |
| 3D-SPS2022.04 | 51.5 | 58.1 | 45.1 | 48 | 53.2 | — | — | |
| 3D-SPS2024.10 | 51.5 | 58.1 | 45.1 | 48 | 53.2 | — | — | |
| 3D-SPSType=Supervised2026.01 | 51.5 | 58.1 | 45.1 | 55.4 | 53.2 | — | — | |
| SSR3D-LLMBackbone=Tiny-Vicuna-1B, FT (Grounding-specific training or finetuning)=true2026.05 | 50.3 | 61 | 39.9 | 46.5 | 52.1 | — | — | |
| M3DRef-CLIPBackbone=CLIP, FT (Grounding-specific training or finetuning)=true2026.05 | 49.4 | 55.6 | 43.4 | 42.3 | 52.9 | — | — | |
| Reason3DVG-8BFine-tuned on Training Set=false, Oracle class label=true, Source=Ours2026.01 | 49.3 | 63 | 36.7 | 40.1 | 54.5 | — | — | |
| SATPublication=ICCV212022.04 | 49.2 | 56.3 | 42.4 | 46.9 | 50.4 | — | — | |
| SAT2024.10 | 49.2 | 56.3 | 42.4 | 46.9 | 50.4 | — | — | |
| SATType=Supervised2026.01 | 49.2 | 56.3 | 42.4 | 54 | 50.4 | — | — | |
| LARobject proposals=ground-truth2023.08 | 48.9 | 58.4 | 42.3 | 47.4 | 52.1 | — | — | |
| LAR2024.10 | 48.9 | 56.1 | 41.8 | 46.7 | 50.2 | — | — | |
| TSP3DSupervision=Supervised2025.12 | 48.7 | — | — | — | — | — | — | |
| TransRefer3Dobject proposals=ground-truth2023.08 | 48 | 56.7 | 39.6 | 42.5 | 50.7 | — | — | |
| VLM-GrounderType=Zero-shot2026.01 | 48 | 55.2 | 39.5 | 45.8 | 49.4 | — | — | |
| VLM-GrounderSupervision=Zero-Shot, VLM=GPT-4o [37]2025.12 | 48 | 55.2 | 39.5 | 45.8 | 49.4 | — | — | |
| VLM-GrounderBackbone=GPT-4V, FT (Grounding-specific training or finetuning)=false2026.05 | 48 | 55.2 | 39.5 | 45.8 | 49.4 | — | — | |
| SeeGroundType=Zero-shot2026.01 | 46.1 | 54.8 | 38.3 | 42.3 | 48.2 | — | — | |
| SeeGroundSupervision=Zero-Shot, VLM=Qwen2-VL-72b [55]2025.12 | 46.1 | 54.5 | 38.3 | 42.3 | 48.2 | — | — | |
| SeeGroundBackbone=Qwen2-VL-72B, FT (Grounding-specific training or finetuning)=false2026.05 | 46.1 | 54.5 | 38.3 | 42.3 | 48.2 | — | — | |
| LanguageReferPublication=CoRL212022.04 | 43.9 | 51 | 36.6 | 41.7 | 45 | — | — | |
| LanguageRefer2024.10 | 43.9 | 51 | 36.6 | 41.7 | 45 | — | — | |
| LanguageReferType=Supervised2026.01 | 43.9 | 51 | 36.6 | 47.7 | 45 | — | — | |
| LanguageReferFine-tuned on Training Set=true, Source=CoRL'222026.01 | 43.9 | 51 | 36.6 | 41.7 | 45 | — | — | |
| TransRefer3D2024.10 | 42.1 | 48.5 | 36 | 36.5 | 44.9 | — | — | |
| TransRefer3DType=Supervised2026.01 | 42.1 | 48.5 | 36 | 45.4 | 44.9 | — | — | |
| TransRefer3DFine-tuned on Training Set=true, Source=MM'212026.01 | 42.1 | 48.5 | 36 | 36.5 | 44.9 | — | — | |
| FFL-3DOGFine-tuned on Training Set=true, Source=ICCV'212026.01 | 41.7 | 48.2 | 35 | 37.1 | 44.7 | — | — | |
| 3DVG-Transobject proposals=ground-truth2023.08 | 40.8 | 48.5 | 34.8 | 34.8 | 43.7 | — | — | |
| 3DVG-TransformerPublication=ICCV212022.04 | 40.8 | 48.5 | 34.8 | 34.8 | 43.7 | — | — | |
| 3DVG-TransformerSupervision=Fully supervised2023.11 | 40.8 | 48.5 | 34.8 | 34.8 | 43.7 | — | — | |
| 3DVG-TransType=Supervised2026.01 | 40.8 | 48.5 | 34.8 | 44.3 | 43.7 | — | — | |
| 3DVG-TransformerFine-tuned on Training Set=true, Source=ICCV'212026.01 | 40.8 | 48.5 | 34.8 | 34.8 | 43.7 | — | — | |
| 3DVG-Trans2025.09 | 40.8 | — | 34.8 | 34.8 | — | — | — | |
| Reason3DVG-8BFine-tuned on Training Set=false, Source=Ours2026.01 | 40.4 | 50.4 | 31 | 37.3 | 42 | — | — | |
| OursZero-shot=true, Modality=2D + 3D2023.11 | 39 | 46.5 | 31.7 | 36.8 | 40 | — | — | |
| ZS-3DVGType=Zero-shot2026.01 | 39 | 46.5 | 31.7 | 36.8 | 40 | — | — | |
| 3DRefTransformerFine-tuned on Training Set=true, Source=WACV'222026.01 | 39 | 46.4 | 32 | 34.7 | 41.2 | — | — | |
| ZSVG3DFine-tuned on Training Set=false, Source=CVPR'242026.01 | 39 | 46.5 | 31.7 | 36.8 | 40 | — | — | |
| ZSVG3DSupervision=Zero-Shot, VLM=GPT-4 turbo [37]2025.12 | 39 | 46.5 | 31.7 | 36.8 | 40 | — | — | |
| ZSVG3DBackbone=GPT-4 + CLIP, FT (Grounding-specific training or finetuning)=false2026.05 | 39 | 46.5 | 31.7 | 36.8 | 40 | — | — | |
| InstanceReferPublication=ICCV212022.04 | 38.8 | 46 | 31.8 | 34.5 | 41.9 | — | — | |
| InstanceReferSupervision=Fully supervised2023.11 | 38.8 | 46 | 31.8 | 34.5 | 41.9 | — | — | |
| InstanceReferType=Supervised2026.01 | 38.8 | 46 | 31.8 | 43.5 | 41.9 | — | — | |
| InstanceReferFine-tuned on Training Set=true, Source=ICCV'212026.01 | 38.8 | 46 | 31.8 | 34.5 | 41.9 | — | — | |
| SeeGroundFine-tuned on Training Set=false, Backbone=InternVL2-26B, Source=CVPR'252026.01 | 38 | 46.8 | 29.8 | 34.7 | 39.8 | — | — | |
| TGNNPublication=AAAI212022.04 | 37.3 | 44.2 | 30.6 | 35.8 | 38 | — | — | |
| TGNNType=Supervised2026.01 | 37.3 | 44.2 | 30.6 | 35.8 | 38 | — | — | |
| TGNNFine-tuned on Training Set=true, Source=AAAI'212026.01 | 37.3 | 44.2 | 30.6 | 35.8 | 38 | — | — | |
| Ours (3D only)Zero-shot=true, Modality=3D only2023.11 | 36.7 | 45.9 | 27.9 | 34.9 | 38.4 | — | — | |
| ReferIt3DNetPublication=ECCV202022.04 | 35.6 | 43.6 | 27.9 | 32.5 | 37.1 | — | — | |
| ReferIt3DNetSupervision=Fully supervised2023.11 | 35.6 | 43.6 | 27.9 | 32.5 | 37.1 | — | — | |
| ReferIt3DType=Supervised2026.01 | 35.6 | 43.6 | 27.9 | 32.5 | 37.1 | — | — | |
| ReferIt3DNetFine-tuned on Training Set=true, Source=ECCV'202026.01 | 35.6 | 43.6 | 27.9 | 32.5 | 37.1 | — | — | |
| ReferIt3D2025.09 | 35.6 | — | 27.9 | 32.5 | — | — | — | |
| ReferIt3DNetBackbone=3D listener, FT (Grounding-specific training or finetuning)=true2026.05 | 35.6 | 43.6 | 27.9 | 32.5 | 37.1 | — | — |