Visual Question Answering (Multiple-Choice) on VQA (test-standard)
70.1Accuracy (All)Ensemble of 7 Att. models
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Ensemble of 7 Att. modelsTraining Split=train+val2016.06 | 70.1 | — | — | — | |
| Naver Labs (challenge 2nd)Training Split=train+val2016.06 | 69.3 | — | — | — | |
| 3-Modalities: Unary+Pairwise+TernaryBackbone=ResNet2017.11 | 69.3 | — | — | — | |
| DANBackbone=ResNet2017.11 | 69 | — | — | — | |
| 3-Modalities: Unary+PairwiseBackbone=ResNet2017.11 | 68.7 | — | — | — | |
| RAUBackbone=ResNet2017.11 | 67.3 | — | — | — | |
| MRNevaluation_split=test-standard2016.06 | 66.33 | 82.41 | 39.57 | 58.4 | |
| HieCoAttTraining Split=train+val2016.06 | 66.1 | — | — | — | |
| Hierarchical Co-Attention (Alternating) + ResNetBackbone=ResNet, Attention Mechanism=Alternating co-attention2016.05 | 66.1 | — | — | — | |
| HieCoAttBackbone=ResNet2017.11 | 66.1 | — | — | — | |
| FDABackbone=ResNet2016.05 | 64.2 | — | — | — | |
| FDAevaluation_split=test-standard2016.06 | 64.18 | 81.25 | 38.3 | 55.2 | |
| VQA teamTraining Split=train+val2016.06 | 63.1 | — | — | — | |
| LSTM Q+IBackbone=VGGNet2016.05 | 63.1 | — | — | — | |
| Deep Q+Ievaluation_split=test-standard2016.06 | 63.09 | 80.59 | 37.7 | 53.64 | |
| DPPnetevaluation_split=test-standard2016.06 | 62.69 | 80.35 | 38.79 | 52.79 | |
| iBOWIMGTraining Split=train+val2016.06 | 62 | — | — | — |