Segment-level Video Captioning on ViTT-All (test)
43.34BLEU-1Human
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| HumanInput=Video + ASR2020.11 | 43.34 | 33.56 | 41.88 | 1.26 | |
| E2vidD6-MASSvid-BiDInput=Video + ASR, Pre-training strategy=Multimodal Pretraining2020.11 | 22.45 | 10.76 | 31.49 | 0.8 | |
| E2vidD6-MASS-BiDInput=Video + ASR, Pre-training strategy=Text Pretraining2020.11 | 22.44 | 10.83 | 31.27 | 0.81 | |
| E2vidD6-MASSdrop-BiDInput=Video + ASR, Pre-training strategy=Multimodal Pretraining2020.11 | 22.37 | 11 | 31.4 | 0.82 | |
| E2vidD6-MASSalign-BiDInput=Video + ASR, Pre-training strategy=Multimodal Pretraining2020.11 | 22.31 | 10.66 | 31.13 | 0.79 | |
| E2D6-MASS-BiDInput=ASR, Pre-training strategy=Text Pretraining2020.11 | 21.93 | 10.6 | 30.45 | 0.79 | |
| E2D6-BiDInput=ASR, Pre-training strategy=Ø Pretraining2020.11 | 19.6 | 9.12 | 27.88 | 0.68 | |
| E2vidD6-BiDInput=Video + ASR, Pre-training strategy=Ø Pretraining2020.11 | 19.49 | 9.23 | 28.53 | 0.69 | |
| Constant baseline (“intro”)Input=-2020.11 | 1.42 | 3.32 | 11.15 | 0.28 |