Image Question Answering on DAQUAR REDUCED (test)
60.3AccuracyHuman
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Human2015.11 | 60.3 | 61 | 79 | |
| Human Baseline2016.03 | 60.27 | 61.04 | 78.96 | |
| SAN(2, LSTM)Number of Layers=2, Language Model=LSTM2015.11 | 46.2 | 51.2 | 85.1 | |
| A+C+Selected-K-LSTM2016.03 | 46.13 | 51.83 | 83.95 | |
| Att+Cap+Know-LSTM2016.03 | 45.79 | 51.53 | 83.91 | |
| SAN(2, CNN)Number of Layers=2, Language Model=CNN2015.11 | 45.5 | 50.2 | 83.6 | |
| Yang et al.2016.03 | 45.5 | 50.2 | 83.6 | |
| SAN(1, LSTM)Number of Layers=1, Language Model=LSTM2015.11 | 45.2 | 49.6 | 84 | |
| SAN(1, CNN)Number of Layers=1, Language Model=CNN2015.11 | 45.2 | 49.6 | 83.7 | |
| Att+Cap-LSTM2016.03 | 44.78 | 50.07 | 83.85 | |
| Noh et al.2016.03 | 44.48 | 49.56 | 83.95 | |
| Att+Know-LSTM2016.03 | 41.08 | 46.04 | 82.39 | |
| Cap+Know-LSTM2016.03 | 40.81 | 45.04 | 82.01 | |
| Xu et al.2016.03 | 40.07 | — | — | |
| Att-LSTM2016.03 | 40.07 | 45.43 | 82.67 | |
| IMG-CNN2015.11 | 39.7 | 44.9 | 83.1 | |
| Ma et al.2016.03 | 39.66 | 44.86 | 83.06 | |
| VggNet+ft-LSTMFine-tuned=true, Backbone=VggNet2016.03 | 39.13 | 44.03 | 83.33 | |
| VggNet-LSTMFine-tuned=false, Backbone=VggNet2016.03 | 38.72 | 43.97 | 83.01 | |
| 2-VIS+BLSTM2015.11 | 35.8 | 46.8 | 82.2 | |
| 2-VIS+BLSTM2016.03 | 35.78 | 46.83 | 82.15 | |
| Language + IMGInput=Language and Image2015.11 | 34.7 | 40.8 | 79.5 | |
| Askneuron2016.03 | 34.68 | 40.76 | 79.54 | |
| VIS+LSTM2016.03 | 34.41 | 46.05 | 82.23 | |
| VIS+LSTM2015.11 | 34.4 | 46.1 | 82.2 | |
| IMG+BOW2015.11 | 34.2 | 45 | 81.5 | |
| VIS+BOW2016.03 | 34.17 | 44.99 | 81.48 | |
| BOW2015.11 | 32.7 | 43.2 | 81.3 | |
| LSTM2015.11 | 32.7 | 43.5 | 81.6 | |
| LanguageInput=Language only2015.11 | 31.7 | 38.4 | 80.1 | |
| GUESS2016.03 | 18.24 | 29.65 | 77.59 | |
| GUESS2015.11 | 18.2 | 29.7 | 77.6 | |
| Multi-World2015.11 | 12.7 | 18.2 | 51.5 |