Visual Grounding on RefM3FD RGBT-Ground (val)
73.21Acc@0.5RGBT-VGNet
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBT-VGNetBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 73.21 | |
| MV-HiVG-BBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 69.64 | |
| MV-OneRef-LBackbone=BEIT3-L / BEIT3-L, Modality=RGB+TIR2025.12 | 67.26 | |
| MV-HiVG-LBackbone=CLIP-L / CLIP-L, Modality=RGB+TIR2025.12 | 63.16 | |
| MV-OneRef-BBackbone=BEIT3-B / BEIT3-B, Modality=RGB+TIR2025.12 | 62.5 | |
| MV-D-MDETRBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 48.81 | |
| MV-MMCABackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 46.43 | |
| MV-TransVGBackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 45.83 | |
| MV-D-MDETRBackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 44.64 | |
| MV-CLIP-VGBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 34.52 |