Visual Question Answering on Visual-7W pointing questions
72.53AccuracyCMN (full model)
Evaluation Results
| Method | Links | |
|---|---|---|
| CMN (full model)Language Parsing=End-to-end optimized, Supervision=Weak supervision, Backbone=Faster-RCNN VGG-162016.11 | 72.53 | |
| Baseline (loc module)Module=localization module only, Supervision=Weak supervision, Backbone=Faster-RCNN VGG-162016.11 | 71.61 | |
| CMN (w/ external parser)Language Parsing=Stanford Parser [31, 19], Supervision=Weak supervision, Backbone=Faster-RCNN VGG-162016.11 | 61.66 | |
| Zhu et al.2016.11 | 56.1 |