Visual Grounding on RefFLIR 1.0 (val)
73.68Accuracy @ 0.5 IoURGBT-VGNet
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBT-VGNetVisual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB+TIR, Evaluation Setting=Baseline2025.12 | 73.68 | |
| HiVG-BVenue=ACMMM’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 69.08 | |
| HiVG-LVenue=ACMMM’24, Visual / Language Backbone=CLIP-L / CLIP-L, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 68.75 | |
| HiVG-BVenue=ACMMM’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 68.75 | |
| OneRef-LVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-L / BEIT3-L, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 66.61 | |
| HiVG-LVenue=ACMMM’24, Visual / Language Backbone=CLIP-L / CLIP-L, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 65.79 | |
| OneRef-LVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-L / BEIT3-L, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 64.14 | |
| OneRef-BVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-B / BEIT3-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 63.82 | |
| OneRef-BVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-B / BEIT3-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 62.01 | |
| D-MDETRVenue=TPAMI’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 57.07 | |
| TransVGVenue=ICCV’21, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 50.74 | |
| D-MDETRVenue=TPAMI’24, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 50.57 | |
| MMCAVenue=ACMMM’24, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 50.16 | |
| TransVGVenue=ICCV’21, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 49.92 | |
| D-MDETRVenue=TPAMI’24, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 49.67 | |
| MMCAVenue=ACMMM’24, Visual / Language Backbone=RN50+DETR / BERT-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 48.52 | |
| D-MDETRVenue=TPAMI’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 48.36 | |
| CLIP-VGVenue=TMM’23, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB, Evaluation Setting=Single source dataset training2025.12 | 43.68 | |
| OneRef-LVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-L / BEIT3-L, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 38.82 | |
| CLIP-VGVenue=TMM’23, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=TIR, Evaluation Setting=Single source dataset training2025.12 | 36.59 | |
| HiVG-LVenue=ACMMM’24, Visual / Language Backbone=CLIP-L / CLIP-L, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 34.05 | |
| OneRef-BVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-B / BEIT3-B, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 32.89 | |
| HiVG-BVenue=ACMMM’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 23.03 | |
| OneRef-LVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-L / BEIT3-L, Visual Modality=TIR, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 21.55 | |
| OneRef-BVenue=NeurIPS’24, Visual / Language Backbone=BEIT3-B / BEIT3-B, Visual Modality=TIR, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 21.38 | |
| HiVG-LVenue=ACMMM’24, Visual / Language Backbone=CLIP-L / CLIP-L, Visual Modality=TIR, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 18.26 | |
| HiVG-BVenue=ACMMM’24, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=TIR, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 10.86 | |
| CLIP-VGVenue=TMM’23, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=RGB, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 5.59 | |
| CLIP-VGVenue=TMM’23, Visual / Language Backbone=CLIP-B / CLIP-B, Visual Modality=TIR, Evaluation Setting=Pretrained model zero-shot transfer2025.12 | 4.77 |