Video Captioning on TVC
74.1CIDErVAST
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VASTmodality track=Multi-modal2023.05 | 74.1 | — | — | — | |
| VAST(1.3B)Sample=442M, Audio or subtitle modalities=true2023.05 | 74.1 | 19.9 | — | — | |
| Method [19]modality track=Vision-only2023.05 | 66.1 | — | — | — | |
| GIT2(5.1B)Sample=12.9B, Audio or subtitle modalities=false2023.05 | 66.1 | 16.9 | — | — | |
| Method [62]modality track=Multi-modal2023.05 | 66 | — | — | — | |
| CLIP4Caption++Sample=400M, Audio or subtitle modalities=true2023.05 | 66 | 15 | — | — | |
| GITSample=1.7B, Audio or subtitle modalities=false2023.05 | 63 | 16.2 | — | — | |
| SWINBERTModality=V2021.11 | 55.4 | 14.5 | 36.1 | 18.5 | |
| SwinBERTSample=None, Audio or subtitle modalities=false2023.05 | 55.4 | 14.5 | — | — | |
| VALUEModality=V+T2021.11 | 50.5 | 11.6 | 33.9 | 17.6 | |
| VALUESample=136M, Audio or subtitle modalities=true2023.05 | 50.5 | 11.6 | — | — | |
| HEROModality=V+T2021.11 | 49.9 | 12.3 | 34.1 | 17.6 | |
| MMTModality=V+T2021.11 | 45.3 | 10.8 | 32.8 | 16.9 | |
| MMTModality=V2021.11 | 36 | 9.9 | 30.4 | 15.2 | |
| MMTModality=T2021.11 | 33.7 | 6.3 | 7.7 | 13.9 |