Visual Grounding on Flickr30k Entities (test)
86.59AccuracyAMC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AMC2022.06 | 86.59 | — | — | |
| AMC*training_data_restriction=Visual Genome (VG) box and labels only2022.06 | 86.49 | — | — | |
| VMRMDetector=Faster-RCNN (VG)2022.06 | 81.11 | — | — | |
| Our approachBackbone=ResNet-1012019.11 | 76.74 | — | — | |
| InfoGroundDetector=Faster-RCNN (VG)2022.06 | 76.74 | — | — | |
| 12-in-1Detector=Faster-RCNN (VG)2022.06 | 76.4 | — | — | |
| DDPN2019.11 | 73.3 | — | — | |
| Align2GroundDetector=Faster-RCNN (VG)2022.06 | 71 | — | — | |
| Our approachBackbone=ResNet-502019.11 | 67.9 | — | — | |
| SeqGROUND2019.11 | 61.6 | — | — | |
| CITE2019.11 | 59.27 | — | — | |
| SS+QRN2019.11 | 55.99 | — | — | |
| SPC+PPC2019.11 | 55.49 | — | — | |
| IGOP2019.11 | 53.97 | — | — | |
| Similarity Network2019.11 | 51.05 | — | — | |
| RtP2019.11 | 50.89 | — | — | |
| MCBPooling=Multimodal Compact Bilinear, Proposals=Selective Search, Backbone=VGG16, Embedding size=500, d=20482016.06 | 48.69 | — | — | |
| MCB2019.11 | 48.69 | — | — | |
| Element-wise Product + ConvType=Ablation (Element-wise Product + 2048-D Conv), Proposals=Selective Search, Backbone=VGG16, Embedding size=5002016.06 | 47.86 | — | — | |
| Rohrbach et al. (2016)Proposals=Selective Search, Backbone=VGG162016.06 | 47.81 | — | — | |
| GroundeR2019.11 | 47.81 | — | — | |
| Element-wise ProductType=Ablation (Element-wise Product), Proposals=Selective Search, Backbone=VGG16, Embedding size=5002016.06 | 47.41 | — | — | |
| ConcatenationType=Ablation (Simple Concatenation), Proposals=Selective Search, Backbone=VGG16, Embedding size=5002016.06 | 46.5 | — | — | |
| Wang et al. (2016)2016.06 | 43.89 | — | — | |
| NonlinearSP2019.11 | 43.89 | — | — | |
| Plummer et al. (2016)Notes=Footnote mentions 50.89% with box size/color features2016.06 | 43.84 | — | — | |
| SMPL2019.11 | 42.08 | — | — | |
| Hu et al. (2016b)2016.06 | 27.8 | — | — | |
| Plummer et al. (2015)2016.06 | 27.42 | — | — | |
| DDPNStage=Two-stage, Visual Encoder=RN1012022.03 | — | — | 73.3 | |
| DIGNModule=Two-stage, Backbone=VGG-162022.03 | — | 78.73 | — | |
| FAOAModule=One-stage, Backbone=DarkNet-532022.03 | — | 68.71 | — | |
| FAOAStage=One-stage, Visual Encoder=DN53, Time (ms)=232022.03 | — | — | 68.71 | |
| LCMCGModule=Two-stage, Backbone=ResNet-1012022.03 | — | 76.74 | — | |
| QRNetModule=One-stage, Backbone=Swin-S2022.03 | — | 81.95 | — | |
| RefTRStage=One-stage, Visual Encoder=RN101, Time (ms)=402022.03 | — | — | 78.66 | |
| ReSC-LargeModule=One-stage, Backbone=DarkNet-532022.03 | — | 69.28 | — | |
| ReSCLStage=One-stage, Visual Encoder=DN53, Time (ms)=362022.03 | — | — | 69.28 | |
| SAFFModule=One-stage, Backbone=DarkNet-532022.03 | — | 70.71 | — | |
| SeqTRStage=One-stage, Visual Encoder=DN53, Time (ms)=502022.03 | — | — | 81.23 | |
| Similarity netModule=Two-stage, Backbone=ResNet-1012022.03 | — | 50.89 | — | |
| SimilarityNetStage=Two-stage, Visual Encoder=RN101, Time (ms)=1842022.03 | — | — | 60.89 | |
| TransVGModule=One-stage, Backbone=ResNet-1012022.03 | — | 79.1 | — | |
| TransVGStage=One-stage, Visual Encoder=RN101, Time (ms)=622022.03 | — | — | 79.1 | |
| TransVG (Swin)Module=One-stage, Backbone=Swin-S2022.03 | — | 78.18 | — | |
| ZSGNetStage=One-stage, Visual Encoder=RN502022.03 | — | — | 63.39 |