Image Captioning on MS COCO 40,775 images (test)
133.5CIDErX-Transformer
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| X-TransformerBackbone=SENet-1542020.03 | 133.5 | 72.4 | 95.7 | 75 | 39.2 | 90.5 | 82.5 | |
| X-LANBackbone=SENet-1542020.03 | 132.8 | 72.4 | 95.7 | 75.2 | 39.3 | 90.5 | 82.4 | |
| X-TransformerBackbone=ResNet-1012020.03 | 131.4 | 71.8 | 95.4 | 74.9 | 39 | 90 | 81.7 | |
| X-LANBackbone=ResNet-1012020.03 | 130.3 | 71.4 | 95.3 | 74.7 | 38.9 | 89.8 | 81.5 | |
| HIPBackbone=SENet-1542020.03 | 130.2 | 71 | 95.9 | 74.1 | 38.1 | 90.4 | 81.6 | |
| AoANetBackbone=ResNet-1012020.03 | 129.6 | 71.2 | 95 | 74.5 | 38.5 | 89.6 | 81.3 | |
| SGAEBackbone=ResNet-1012020.03 | 126.5 | 69.7 | 95.3 | 73.6 | 37.2 | 89.5 | 80.4 | |
| GCN-LSTMBackbone=ResNet-1012020.03 | 126.5 | 69.7 | 95.2 | 73.4 | 37.6 | 89.3 | 80.3 | |
| RFNetBackbone=ResNet+DenseNet+Inception2020.03 | 125.1 | 69.2 | 95 | 73.1 | 37.2 | 89.3 | 80.1 | |
| Up-DownBackbone=ResNet-1012020.03 | 120.5 | 68.5 | 95.2 | 72.4 | 36.7 | 88.8 | 79.4 | |
| LSTM-ABackbone=ResNet-1522020.03 | 118 | 65.2 | 93.7 | 70.5 | 35.4 | 86.7 | 76.5 | |
| VGG+Score+DMSM+ftNumber of reference captions=402014.11 | 0.925 | 0.567 | 0.88 | 0.662 | 0.331 | — | — | |
| VGG+Score+DMSM+ftNumber of reference captions=52014.11 | 0.912 | 0.291 | 0.695 | 0.519 | 0.247 | — | — | |
| HumanNumber of reference captions=402014.11 | 0.91 | 0.471 | 0.88 | 0.626 | 0.335 | — | — | |
| HumanNumber of reference captions=52014.11 | 0.854 | 0.217 | 0.663 | 0.484 | 0.252 | — | — |