Image Captioning on FashionGen (test)
30.73BLEUFAME-ViL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FAME-ViLtraining=Multi-Task Learning, backbone=ViT-B/162023.03 | 30.73 | 25.04 | 55.83 | 150.4 | 65.5 | |
| FAME-ViL(ST)training=Single-Task Learning, backbone=ViT-B/162023.03 | 29.97 | 24.83 | 54.79 | 145.1 | 63.67 | |
| FashionViLbackbone=ResNet-50, decoding=MLM auto-regressively2023.03 | 16.71 | 25.97 | 37.82 | 39.08 | 29.9 | |
| FashionViL (vit)backbone=ViT-B/16, decoding=MLM auto-regressively2023.03 | 16.18 | 25.6 | 37.23 | 39.3 | 29.58 | |
| KaleidoBERT2023.03 | 5.7 | 12.8 | 32.9 | 32.6 | 21 | |
| OSCAROriginal Protocol=†2023.03 | 4.5 | 10.9 | 30.1 | 30.7 | 19.05 | |
| FashionBERTOriginal Protocol=†2023.03 | 3.3 | 9.8 | 29.7 | 30.1 | 18.23 |