Visual Storytelling on VIST (test) using Generation Metrics (BLEU/METEOR/ROUGE/CIDEr)
35.7METEORTAVST
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| TAVSTTraining Objective=RL2019.11 | 35.7 | 64.2 | 39.6 | 23.7 | 14.6 | — | 9.2 | 31 | — | |
| INet2020.02 | 35.6 | 64.4 | 40.1 | 23.9 | 14.7 | 29.7 | 10 | — | — | |
| TAVSTTraining Objective=MLE2019.11 | 35.4 | 63.6 | 39.3 | 23.4 | 14.2 | — | 8.7 | 30.3 | — | |
| TAVST w/o IUTraining Objective=RL2019.11 | 35.3 | 63.5 | 39.2 | 23.2 | 14.3 | — | 8.7 | 30 | — | |
| HSRL2020.02 | 35.2 | — | — | — | 12.3 | 30.8 | 10.7 | — | — | |
| ARELTraining objective=Implicit reward with imitation learning2019.09 | 35.2 | — | — | — | 13.6 | — | 9.1 | 29.3 | 8.9 | |
| BLEU-RLBackbone=ResNet-152, Word embedding size=300, LSTM hidden units=512, Dropout rate=0.3, Training objective=MLE + REINFORCE (sentence-level BLEU reward)2019.09 | 35.2 | — | — | — | 14.4 | — | 6.7 | 30.1 | 8.3 | |
| HSRLTraining Objective=RL2019.11 | 35.2 | — | — | — | 12.3 | — | 10.7 | 30.8 | — | |
| TAVST w/o IUTraining Objective=MLE2019.11 | 35.1 | 63.1 | 38.6 | 22.9 | 14 | — | 8.5 | 29.7 | — | |
| GAN2020.02 | 35 | 62.8 | 38.8 | 23 | 14 | 29.5 | 9 | — | — | |
| ARELvariant=best2020.02 | 35 | 63.8 | 39.1 | 23.2 | 14.1 | 29.5 | 9.4 | — | — | |
| ARELTraining Objective=RL2019.11 | 35 | 63.7 | 39 | 23.1 | 14 | — | 9.5 | 29.6 | — | |
| XE-ss2020.02 | 34.8 | 62.3 | 38.2 | 22.5 | 13.7 | 29.7 | 8.7 | — | — | |
| MLEBackbone=ResNet-152, Word embedding size=300, LSTM hidden units=512, Dropout rate=0.3, Training objective=Maximum Likelihood Estimation2019.09 | 34.8 | — | — | — | 14.3 | — | 7.2 | 30 | 8.5 | |
| HPSR2020.02 | 34.4 | 61.9 | 37.9 | 21.5 | 12.2 | 31.2 | 8 | — | — | |
| HPSRTraining Objective=MLE2019.11 | 34.4 | 61.9 | 37.8 | 21.5 | 12.2 | — | 8 | 31.2 | — | |
| VSTTraining Objective=MLE2019.11 | 34.3 | 62.3 | 38 | 21.8 | 12.7 | — | 7.8 | 29.7 | — | |
| Yu et al.2020.02 | 34.1 | — | — | 21 | — | 29.5 | 7.5 | — | — | |
| h-attn-rankTraining Objective=MLE2019.11 | 34.1 | — | — | 21 | — | — | 7.5 | 29.5 | — | |
| ReCo-RLBackbone=ResNet-152, Word embedding size=300, LSTM hidden units=512, Dropout rate=0.3, Training objective=MLE + REINFORCE (designed rewards)2019.09 | 33.9 | — | — | — | 12.1 | — | 8.6 | 29.9 | 8.3 | |
| Huang et al.2020.02 | 31.4 | — | — | — | — | — | — | — | — | |
| seq2seqTraining Objective=MLE2019.11 | 31.4 | — | — | — | 3.5 | — | 6.8 | — | — | |
| HSRLTraining objective=Hierarchical RL with topic consistency constraint2019.09 | 30.1 | — | — | — | 9.8 | — | 5.9 | 25.1 | 7.5 | |
| Vision Transformer Based Model2022.10 | 0.354 | 0.63 | 0.375 | 0.215 | 0.123 | — | 0.044 | 31 | — | |
| AREL2022.10 | 0.352 | 0.536 | 0.315 | 0.173 | 0.099 | — | 0.038 | 28.6 | — | |
| BLEU-RL2022.10 | 0.352 | — | — | — | 0.144 | — | 0.067 | 30.1 | — | |
| VS with MPJA2022.10 | 0.344 | 0.601 | 0.325 | 0.133 | 0.082 | — | 0.042 | 30.3 | — | |
| HCBNet2022.10 | 0.34 | 0.59 | 0.348 | 0.191 | 0.105 | — | 0.051 | 27.4 | — | |
| ReCo-RL2022.10 | 0.339 | — | — | — | 0.124 | — | 0.086 | 29.9 | — | |
| HCBNetAttention Configuration=without description attention2022.10 | 0.337 | 0.58 | 0.345 | 0.194 | 0.108 | — | 0.043 | 27.1 | — | |
| CAMT2022.10 | 0.335 | 0.64 | 0.361 | 0.201 | 0.184 | — | 0.042 | 30.3 | — | |
| SAESModel Components=Encoder OD2022.10 | 0.335 | 0.65 | 0.372 | 0.204 | 0.12 | — | 0.054 | 30.3 | — | |
| HCBNetBackbone=VGG2022.10 | 0.334 | 0.59 | 0.34 | 0.186 | 0.104 | — | 0.051 | 26.9 | — | |
| HCBNetAttention Configuration=without previous sentence attention2022.10 | 0.332 | 0.59 | 0.338 | 0.18 | 0.097 | — | 0.057 | 27.1 | — | |
| SAESModel Components=Encoder-Decoder OD & Noun2022.10 | 0.331 | 0.63 | 0.357 | 0.195 | 0.109 | — | 0.048 | 29.9 | — | |
| SAESModel Components=Encoder-Decoder OD2022.10 | 0.33 | 0.64 | 0.363 | 0.196 | 0.106 | — | 0.051 | 29.4 | — | |
| Rand+RNN2022.10 | 0.311 | — | — | 0.133 | 0.061 | — | 0.022 | 27.2 | — | |
| GLACNet2022.10 | 0.306 | 0.56 | 0.321 | 0.171 | 0.091 | — | 0.041 | 26.4 | — |