Visual Captioning on MSR-VTT English
13.3BLEU@4MultiCapCLIP
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MultiCapCLIPSettings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 13.3 | 19.5 | 43.3 | 15.5 | |
| MAGICSettings=Zero-Shot, Pre-trained Backbone=CLIP + GPT, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 5.5 | 13.3 | 35.4 | 7.4 | |
| ZS-CapCLIP*Settings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 4 | 15 | 31 | 5 | |
| EPTSettings=Zero-Shot, Pre-trained Backbone=CLIP + GPT, Training Data (Vision)=✗, Training Data (Text)=✗2023.08 | 3 | 14.6 | 27.7 | 11.3 | |
| ZeroCapSettings=Zero-Shot, Pre-trained Backbone=CLIP + GPT, Training Data (Vision)=✗, Training Data (Text)=✗2023.08 | 2.3 | 12.9 | 30.4 | 5.8 |