3D Visual Grounding on Multi3DRef (F1 metrics)
60.5F1 Score (IoU=0.5)3DGraphLLM-1B + QuatRoPE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| 3DGraphLLM-1B + QuatRoPEDetector / Segmentation=GT2026.03 | 60.5 | 60.7 | |
| GPT4Scene-HDMBackbone=GPT-4o, FT=false2026.05 | 59.8 | 64.5 | |
| 3DGraphLLM-1BDetector / Segmentation=GT2026.03 | 58.4 | 58.6 | |
| SSR3D-LLMBackbone=Tiny-Vicuna-1B, FT=true2026.05 | 57.9 | 63.1 | |
| Chat-Scene-1B + QuatRoPEDetector / Segmentation=GT2026.03 | 57.7 | 58.1 | |
| 3DGraphLLM-7B + QuatRoPEDetector / Segmentation=Mask3D2026.03 | 56 | 60.6 | |
| 3DGraphLLM-7BDetector / Segmentation=Mask3D2026.03 | 55.4 | 60.1 | |
| Chat-Scene-7B + QuatRoPEDetector / Segmentation=Mask3D2026.03 | 54.8 | 59.5 | |
| Chat-Scene-1BDetector / Segmentation=GT2026.03 | 52.9 | 53.3 | |
| Chat-Scene-7BDetector / Segmentation=Mask3D2026.03 | 52.4 | 57.1 | |
| Chat-SceneBackbone=Vicuna-7B, FT=true2026.05 | 52.4 | 57.1 | |
| PQ3DDetector / Segmentation=PQ3D Promptable2026.03 | 50.1 | — | |
| GPT4Scene-HDBackbone=GPT-4o, FT=false2026.05 | 50 | 53.7 | |
| GPT4SceneBackbone=GPT-4o, FT=false2026.05 | 42.1 | 45.4 | |
| Grounded 3D-LLMBackbone=Tiny-Vicuna-1B, FT=true2026.05 | 40.8 | 44.7 | |
| M3DRef-CLIPDetector / Segmentation=PointGroup2026.03 | 38.4 | 42.8 | |
| M3DRef-CLIPBackbone=CLIP, FT=true2026.05 | 38.4 | 42.8 | |
| D3NetDetector / Segmentation=PointGroup2026.03 | 32.2 | — | |
| 3DJCGDetector / Segmentation=VoteNet2026.03 | 26.6 | — |