Video Captioning on TVC (test)
70.7CIDErCOSA (1.2B)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| COSA (1.2B)Parameters=415M2023.06 | 70.7 | — | — | — | 18.8 | |
| COSA-LParameters=417M2023.06 | 67.5 | — | — | — | 17.7 | |
| GIT2Parameters=12.9B2023.06 | 66.1 | — | — | — | 16.9 | |
| CLIP4Caption++Parameters=400M, Additional modalities=true2023.06 | 66 | — | — | — | 15 | |
| GITParameters=1.7B2023.06 | 63 | — | — | — | 16.2 | |
| COSA-BParameters=17M2023.06 | 61 | — | — | — | 16.2 | |
| COSA-BParameters=5M2023.06 | 59.2 | — | — | — | 15.6 | |
| SWINBERTframes=642021.11 | 56.9 | — | — | — | — | |
| SOTA2021.11 | 51 | — | — | — | — | |
| VALUEParameters=136M, Additional modalities=true2023.06 | 50.5 | — | — | — | 11.6 | |
| HERO# Samples for Multimodal Pretext=7.6M2021.01 | 50 | — | 34.2 | 17.6 | 12.4 | |
| HEROInput Modality=video+subtitle2020.05 | 49.98 | 12.35 | 34.16 | 17.64 | — | |
| VX2TEXT# Samples for Multimodal Pretext=02021.01 | 48.3 | — | 33.1 | 17.4 | 11.9 | |
| MMT# Samples for Multimodal Pretext=02021.01 | 45.4 | — | 32.8 | 16.9 | 10.9 | |
| MMTInput Modality=video+subtitle2020.05 | 45.38 | 10.87 | 32.81 | 16.91 | — | |
| HERO# Samples for Multimodal Pretext=02021.01 | 43.7 | — | 32.6 | 16.5 | 10.9 |