Visual Captioning on MS-COCO English
9.7BLEU@4MultiCapCLIP
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MultiCapCLIPSettings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 9.7 | 15.8 | 37.6 | 30.2 | 8.9 | |
| TSGAN†Settings=Weakly-Supervised, Pre-trained Backbone=Faster R-CNN, Training Data (Vision)=√, Training Data (Text)=√2023.08 | 6.9 | 13 | 32.3 | 28.9 | 8.3 | |
| IC-SME†Settings=Weakly-Supervised, Pre-trained Backbone=ResNet + Faster R-CNN, Training Data (Vision)=√, Training Data (Text)=√2023.08 | 6.5 | 12.9 | 35.1 | 22.7 | — | |
| R2M†Settings=Weakly-Supervised, Pre-trained Backbone=Faster R-CNN, Training Data (Vision)=√, Training Data (Text)=√2023.08 | 6.4 | 13 | 31.3 | 29 | 9.1 | |
| SGM†Settings=Weakly-Supervised, Pre-trained Backbone=Inception + Faster R-CNN, Training Data (Vision)=√, Training Data (Text)=√2023.08 | 6.3 | 14 | 34.5 | 31.9 | 8.6 | |
| UIC†Settings=Weakly-Supervised, Pre-trained Backbone=Inception + Faster R-CNN, Training Data (Vision)=√, Training Data (Text)=√2023.08 | 5.6 | 12.4 | 28.7 | 28.6 | 8.1 | |
| MAGICSettings=Zero-Shot, Pre-trained Backbone=CLIP + GPT, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 5.2 | 12.5 | 30.7 | 18.3 | 5.7 | |
| ZS-CapCLIP*Settings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 3.4 | 13 | 27.6 | 12.2 | 6.2 | |
| ZeroCapSettings=Zero-Shot, Pre-trained Backbone=CLIP + GPT, Training Data (Vision)=✗, Training Data (Text)=✗2023.08 | 2.6 | 11.5 | — | 14.6 | 5.5 |