Visual Grounding on RefM3FD RGBT-Ground (test)
74.34Accuracy @ 0.5RGBT-VGNet
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBT-VGNetBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 74.34 | |
| MV-HiVG-BBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 72.35 | |
| MV-OneRef-LBackbone=BEIT3-L / BEIT3-L, Modality=RGB+TIR2025.12 | 69.7 | |
| MV-HiVG-LBackbone=CLIP-L / CLIP-L, Modality=RGB+TIR2025.12 | 68.67 | |
| MV-OneRef-BBackbone=BEIT3-B / BEIT3-B, Modality=RGB+TIR2025.12 | 63.98 | |
| MV-TransVGBackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 48.04 | |
| MV-MMCABackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 47.83 | |
| MV-D-MDETRBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 46.5 | |
| MV-D-MDETRBackbone=RN50+DETR / BERT-B, Modality=RGB+TIR2025.12 | 45.62 | |
| MV-CLIP-VGBackbone=CLIP-B / CLIP-B, Modality=RGB+TIR2025.12 | 38.92 |