Visual Question Answering on COCO-QA (test)
78.35WUPS (IoU=0.9)A+C+Selected-K-LSTM
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| A+C+Selected-K-LSTMInputs=Vatt + Vcap + Selected Knowledge information2016.03 | 78.35 | 70.98 | 92.87 | — | — | — | — | — | — | — | — | |
| Att+Cap+Know-LSTMInputs=Vatt + Vcap + Vknow2016.03 | 77.14 | 69.73 | 92.5 | — | — | — | — | — | — | — | — | |
| Att+Cap-LSTMInputs=Vatt + Image Caption (Vcap)2016.03 | 76.2 | 69.02 | 92.38 | — | — | — | — | — | — | — | — | |
| Dual-MFA2017.11 | 76.15 | — | 92.29 | 66.49 | 68.86 | 51.32 | 65.89 | 58.92 | — | — | — | |
| HieCoAtt2017.11 | 75.1 | — | 92 | 65.4 | 68 | 51 | 62.9 | 58.8 | — | — | — | |
| Cap+Know-LSTMInputs=Image Caption (Vcap) + External Knowledge (Vknow)2016.03 | 73.31 | 64.31 | 90.01 | — | — | — | — | — | — | — | — | |
| QRU2017.11 | 72.58 | — | 91.62 | 62.5 | 65.06 | 46.9 | 60.5 | 56.99 | — | — | — | |
| Att+Know-LSTMInputs=Vatt + External Knowledge (Vknow)2016.03 | 72.22 | 63.07 | 90.84 | — | — | — | — | — | — | — | — | |
| SAN(2, CNN)Attention layers=2, Question Encoder=CNN2015.11 | 71.6 | 61.6 | 90.9 | — | — | — | — | — | — | — | — | |
| Yang et al.Architecture=Stacked Attention Networks2016.03 | 71.6 | 61.6 | 90.9 | — | — | — | — | — | — | — | — | |
| SAN2017.11 | 71.6 | — | 90.9 | 61.6 | 65.4 | 48.6 | 57.9 | 54 | — | — | — | |
| Att-LSTMInputs=Semantic level attribute representation (Vatt)2016.03 | 71.15 | 61.38 | 91.58 | — | — | — | — | — | — | — | — | |
| SAN(2, LSTM)Attention layers=2, Question Encoder=LSTM2015.11 | 71 | 61 | 90.7 | — | — | — | — | — | — | — | — | |
| DPPnet2015.11 | 70.84 | 61.19 | 90.61 | — | — | — | — | — | — | — | — | |
| Noh et al.2016.03 | 70.84 | 61.19 | 90.61 | — | — | — | — | — | — | — | — | |
| DDPnet2017.11 | 70.84 | — | 90.61 | 61.16 | — | — | — | — | — | — | — | |
| SAN(1, CNN)Attention layers=1, Question Encoder=CNN2015.11 | 70.6 | 60.7 | 90.5 | — | — | — | — | — | — | — | — | |
| SAN(1, LSTM)Attention layers=1, Question Encoder=LSTM2015.11 | 69.6 | 59.6 | 90.1 | — | — | — | — | — | — | — | — | |
| IMG-CNN2017.11 | 68.5 | — | 89.67 | 58.4 | — | — | — | — | — | — | — | |
| Chen et al.2016.03 | 68.44 | 58.1 | 89.85 | — | — | — | — | — | — | — | — | |
| Ensemble2015.11 | 67.9 | 57.84 | 89.52 | — | — | — | — | — | — | — | — | |
| FULL2015.05 | 67.9 | 57.84 | 89.52 | — | — | — | — | — | — | — | — | |
| VggNet+ft-LSTMBackbone=VggNet, Fine-tuned=true2016.03 | 67.32 | 58.34 | 89.13 | — | — | — | — | — | — | — | — | |
| IMG+BOW2015.11 | 66.8 | 55.9 | 89 | — | — | — | — | — | — | — | — | |
| IMG+BOW2015.11 | 66.78 | 55.92 | 88.99 | — | — | — | — | — | — | — | — | |
| IMG+BOW2015.05 | 66.78 | 55.92 | 88.99 | — | — | — | — | — | — | — | — | |
| VIS+BOWEncoding=Bag-of-Words2016.03 | 66.78 | 55.92 | 88.99 | — | — | — | — | — | — | — | — | |
| IMG-CNN2015.11 | 65.4 | 55 | 88.6 | — | — | — | — | — | — | — | — | |
| ConvQA2015.11 | 65.36 | 54.95 | 88.58 | — | — | — | — | — | — | — | — | |
| Ma et al.2016.03 | 65.36 | 54.95 | 88.58 | — | — | — | — | — | — | — | — | |
| 2VIS+BLSTM2015.11 | 65.34 | 55.09 | 88.64 | — | — | — | — | — | — | — | — | |
| 2-VIS+BLSTM2015.05 | 65.34 | 55.09 | 88.64 | — | — | — | — | — | — | — | — | |
| 2-VIS+BLSTMEncoding=Bidirectional LSTM2016.03 | 65.34 | 55.09 | 88.64 | — | — | — | — | — | — | — | — | |
| 2VIS+BLSTM2017.11 | 65.34 | — | 88.64 | 55.09 | 58.17 | 44.79 | 49.53 | 47.34 | — | — | — | |
| 2-VIS+BLSTM2015.11 | 65.3 | 55.1 | 88.6 | — | — | — | — | — | — | — | — | |
| VIS+LSTM2015.05 | 63.91 | 53.31 | 88.25 | — | — | — | — | — | — | — | — | |
| VIS+LSTMEncoding=LSTM2016.03 | 63.91 | 53.31 | 88.25 | — | — | — | — | — | — | — | — | |
| VIS+LSTM2015.11 | 63.9 | 53.3 | 88.3 | — | — | — | — | — | — | — | — | |
| VggNet-LSTMBackbone=VggNet2016.03 | 60.37 | 50.73 | 87.48 | — | — | — | — | — | — | — | — | |
| IMG+PRIOR2015.05 | 60.2 | 44.66 | 86.24 | — | — | — | — | — | — | — | — | |
| IMG2015.05 | 58.64 | 43.02 | 85.85 | — | — | — | — | — | — | — | — | |
| IMG2015.11 | 58.6 | 43 | 85.9 | — | — | — | — | — | — | — | — | |
| K-NNK=31, feature_dimension=132015.05 | 56.98 | 44.96 | 85.57 | — | — | — | — | — | — | — | — | |
| BOW2015.05 | 48.54 | 37.52 | 82.78 | — | — | — | — | — | — | — | — | |
| BOW2015.11 | 48.5 | 37.5 | 82.8 | — | — | — | — | — | — | — | — | |
| LSTM2015.11 | 47.6 | 36.8 | 82.3 | — | — | — | — | — | — | — | — | |
| LSTM2015.05 | 47.58 | 36.76 | 82.34 | — | — | — | — | — | — | — | — | |
| CNN2015.11 | 44.3 | 32.7 | 80.9 | — | — | — | — | — | — | — | — | |
| GUESS2015.05 | 18.37 | 7.3 | 74.13 | — | — | — | — | — | — | — | — | |
| GUESS2016.03 | 17.42 | 6.65 | 73.44 | — | — | — | — | — | — | — | — | |
| GUESS2015.11 | 17.4 | 6.7 | 73.4 | — | — | — | — | — | — | — | — | |
| 2VIS+BLSTM2018.05 | — | — | — | 55.09 | 58.17 | 44.79 | 49.53 | 47.34 | — | — | — | |
| AMA2018.05 | — | — | — | 61.38 | 63.92 | 51.83 | 57.29 | 54.84 | — | — | — | |
| DDPnet2018.05 | — | — | — | 61.16 | — | — | — | — | — | — | — | |
| IMG-CNN2018.05 | — | — | — | 58.4 | — | — | — | — | — | — | — | |
| LoRSDistillation budget=499 pairs, Evaluation protocol=Zero-shot retrieval2026.03 | — | — | — | — | — | — | — | — | 10.8 | 33 | 39.9 | |
| OursDistillation budget=499 pairs, Evaluation protocol=Zero-shot retrieval2026.03 | — | — | — | — | — | — | — | — | 16.3 | 38.9 | 47.4 | |
| QRU2018.05 | — | — | — | 62.5 | 65.06 | 46.9 | 60.5 | 56.99 | — | — | — | |
| RelAtt2018.05 | — | — | — | 65.15 | 67.5 | 48.81 | 62.64 | 58.37 | — | — | — | |
| SAN2018.05 | — | — | — | 61.6 | 65.4 | 48.6 | 57.9 | 54 | — | — | — |