Visual Captioning on VATEX Chinese
8.4BLEU@4MultiCapCLIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MultiCapCLIPSettings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 8.4 | 31.2 | 6.2 | |
| ZS-CapCLIP*Settings=Zero-Shot, Pre-trained Backbone=CLIP, Training Data (Vision)=✗, Training Data (Text)=√2023.08 | 2.8 | 25.8 | 2 |