Visual Grounding on RefM3FD 1.0 (test)
74.34Accuracy@0.5RGBT-VGNet
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBT-VGNetVisual Modality=RGB+TIR, Evaluation Setting=Baseline2025.12 | 74.34 | |
| OneRef-LVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-L / BEIT3-L, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 68.3 | |
| HiVG-LVenue=ACMMM’24, Visual / Language Backbone=CLIP-L / CLIP-L, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 53.1 |