Visual Grounding on ReferItGame (test)
0.63AccuracyDDPN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DDPNBackbone=ResNet-1012018.05 | 0.63 | — | |
| DDPNBackbone=VGG-162018.05 | 0.603 | — | |
| Li et al.2018.05 | 0.442 | — | |
| QRC2018.05 | 0.441 | — | |
| Wu et al.2018.05 | 0.368 | — | |
| MCBBackbone=VGG16 + spatial features, Object Proposals=Edge Box, Embedding size=500, MCB pooling dimension (d)=20482016.06 | 0.2891 | — | |
| MCB2018.05 | 0.289 | — | |
| GroundeR2018.05 | 0.285 | — | |
| Element-wise Product + ConvBackbone=VGG16 + spatial features, Object Proposals=Edge Box, Embedding size=500, Additional Layers=2048-D convolution2016.06 | 0.2798 | — | |
| Element-wise ProductBackbone=VGG16 + spatial features, Object Proposals=Edge Box, Embedding size=5002016.06 | 0.278 | — | |
| Rohrbach et al.Backbone=VGG16, Object Proposals=Selective Search2016.06 | 0.2693 | — | |
| ConcatenationBackbone=VGG16 + spatial features, Object Proposals=Edge Box, Embedding size=5002016.06 | 0.2548 | — | |
| Hu et al.Backbone=VGG16 + spatial features, Object Proposals=Ground-truth bounding boxes2016.06 | 0.1793 | — | |
| SCRC2018.05 | 0.179 | — | |
| DIGNModule=Two-stage, Backbone=VGG-162022.03 | — | 65.15 | |
| FAOAModule=One-stage, Backbone=DarkNet-532022.03 | — | 60.67 | |
| MAttNetModule=Two-stage, Backbone=ResNet-1012022.03 | — | 29.04 | |
| QRNetModule=One-stage, Backbone=Swin-S2022.03 | — | 74.61 | |
| RCCFModule=One-stage, Backbone=DLA-342022.03 | — | 63.79 | |
| ReSC-LargeModule=One-stage, Backbone=DarkNet-532022.03 | — | 64.6 | |
| SAFFModule=One-stage, Backbone=DarkNet-532022.03 | — | 66.01 | |
| Similarity netModule=Two-stage, Backbone=ResNet-1012022.03 | — | 34.54 | |
| TransVGModule=One-stage, Backbone=ResNet-1012022.03 | — | 70.73 | |
| TransVG (Swin)Module=One-stage, Backbone=Swin-S2022.03 | — | 70.86 | |
| VCModule=Two-stage, Backbone=VGG162022.03 | — | 31.13 |