3D Visual Grounding on EmbodiedScan ARKitScenes
28.7Accuracy @ IoU 0.25UniGround
Evaluation Results
| Method | Links | |
|---|---|---|
| UniGroundVenue=Ours, Agent Rep.=PE, Agent VLM=GPT-5, Prior Info. Bbox=✗, Prior Info. Class=✗, Paradigm=Open-World Zero-Shot2026.03 | 28.7 | |
| Embodied PerceptronVenue=CVPR’24, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 25.7 | |
| L3DetVenue=arXiv’23, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 23.1 | |
| BUTD-DETRVenue=ECCV’22, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 22.1 | |
| ScanReferVenue=ECCV’20, Agent Rep.=✗, Agent VLM=✗, Prior Info. Bbox=-, Prior Info. Class=-, Paradigm=Fully Supervised Learning-Based2026.03 | 12.9 | |
| SeeGroundVenue=CVPR’25, Agent Rep.=✗, Agent VLM=Qwen2-VL, Prior Info. Bbox=✓, Prior Info. Class=✓, Paradigm=Open-Vocabulary Zero-Shot2026.03 | 7.7 | |
| SeqVLMVenue=ACM’25, Agent Rep.=✗, Agent VLM=Doubao-1.5, Prior Info. Bbox=✓, Prior Info. Class=✓, Paradigm=Open-Vocabulary Zero-Shot2026.03 | 0.9 |