Video Captioning on MSRVTT (full)
75.9CIDErGiT2
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GiT2Pre-training Data Scale (M)=129002023.05 | 75.9 | — | 54.8 | 33.1 | 68.2 | |
| VLAB_GPre-training Data Scale (M)=262023.05 | 74.9 | — | 54.6 | 33.4 | 68.3 | |
| GiTPre-training Data Scale (M)=8002023.05 | 73.9 | — | 53.8 | 32.9 | 67.7 | |
| VideoCocaPre-training Data Scale (M)=1002023.05 | 73.2 | — | 53.8 | — | 68 | |
| VLAB_LPre-training Data Scale (M)=262023.05 | 72.5 | — | 54.3 | 32.7 | 67.9 | |
| HiTeAPre-training Data Scale (M)=172023.05 | 65.1 | — | 49.2 | 30.7 | 65 | |
| LAVENDERPre-training Data Scale (M)=302023.05 | 60.1 | — | — | — | — | |
| MV-GPTPre-training Data Scale (M)=692023.05 | 60 | — | 48.9 | 38.7 | 64 | |
| CLIP4Caption2023.05 | 57.7 | — | 46.1 | 30.7 | 63.7 | |
| SwinBERT2023.05 | 53.8 | — | 41.9 | 29.9 | 62.1 | |
| UniVL + MELTRModality=V2023.03 | 52.77 | 55.88 | 44.17 | 29.26 | 62.35 | |
| ORG-TRLModality=V2023.03 | 50.9 | — | 43.6 | 28.8 | 62.1 | |
| UniVL*Modality=V2023.03 | 50.04 | 53.42 | 41.79 | 28.94 | 60.78 | |
| UniVLPre-training Data Scale (M)=1362023.05 | 49.9 | — | 42.2 | 28.8 | 61.2 | |
| POS-VCTModality=V2023.03 | 49.1 | — | 42.3 | 29.7 | 62.8 | |
| SibNetModality=V2023.03 | 47.5 | — | 40.9 | 27.5 | 60.2 | |
| MARNModality=V2023.03 | 47.1 | — | 40.4 | 28.1 | 60.7 | |
| OA-BTGModality=V2023.03 | 46.9 | — | 41.4 | 28.2 | — | |
| PickNetModality=V+T2023.03 | 42.1 | — | 38.9 | 27.2 | 59.5 | |
| PickNetModality=V2023.03 | 41 | — | 35.6 | 26.8 | 58.2 |