Visual Grounding on ScanRefer (test, Overall Category)
61.1AccuracyDINOv3 + SpatialBoost
Evaluation Results
| Method | Links | |
|---|---|---|
| DINOv3 + SpatialBoostSpatialBoost=true2026.03 | 61.1 | |
| DINOv2 + SpatialBoostSpatialBoost=true2026.03 | 57 | |
| SigLIPv2 + SpatialBoostSpatialBoost=true2026.03 | 56.8 | |
| OpenCLIP + SpatialBoostSpatialBoost=true2026.03 | 56.6 | |
| DINOv32026.03 | 56.2 | |
| V-JEPAv2Encoder Type=Vision-only2026.03 | 55.5 | |
| DINOv22026.03 | 52.7 | |
| dino.txtEncoder Type=Vision-Language2026.03 | 52.5 | |
| TIPSEncoder Type=Vision-Language2026.03 | 52 | |
| PE-CoreEncoder Type=Vision-Language2026.03 | 51.7 | |
| SigLIPv22026.03 | 51.4 | |
| AIMv2Encoder Type=Vision-Language2026.03 | 50.9 | |
| OpenCLIP2026.03 | 50.1 |