Paragraph-to-Video Retrieval on ActivityNet Captions (test)
54.8R@1TESTA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TESTA#PT Data=5M, #Frame=96, GFLOPS=13812023.10 | 54.8 | 80.8 | — | — | 89.6 | |
| CLIP-ViP#PT Data=100M, #Frame=12, GFLOPS=2122023.10 | 53.4 | 81.4 | — | — | 90 | |
| TESTA#PT Data=5M, #Frame=32, GFLOPS=4202023.10 | 51.7 | 79.1 | — | — | 87.6 | |
| VINDLU#PT Data=5M, #Frame=4, GFLOPS=932023.10 | 51.1 | 79.2 | — | — | 88.4 | |
| X-CLIP#PT Data=400M, #Frame=64, GFLOPS=10862023.10 | 46.2 | 75.5 | — | — | — | |
| HiTeA#PT Data=5M, #Frame=12, GFLOPS=982023.10 | 45.1 | 73.5 | — | — | 84.2 | |
| Singularity#PT Data=5M, #Frame=32, GFLOPS=5892023.10 | 43 | 70.6 | — | — | 81.3 | |
| Clip4Clip#PT Data=400M, #Frame=64, GFLOPS=2822023.10 | 40.5 | 72.4 | — | — | — | |
| TESTAPre-training Data=5M, GFLOPS=786, Evaluation Protocol=Zero-shot, Frames=322023.10 | 37.1 | 63.7 | — | — | 75.4 | |
| LF-VILAPre-training Dataset=LF-VILA-8M2022.10 | 35.3 | 65.4 | 95 | 3 | — | |
| LF-VILA#PT Data=8M, #Frame=32, GFLOPS=2982023.10 | 35.3 | 65.4 | — | — | — | |
| BLIPPre-training Data=129M, GFLOPS=707, Evaluation Protocol=Zero-shot, Frames=322023.10 | 34.2 | 60 | — | — | 70.7 | |
| TACOPre-training Dataset=HowTo100M [36]2022.10 | 30.4 | 61.2 | 93.4 | 3 | — | |
| Support SetPre-training Dataset=HowTo100M [36]2022.10 | 29.2 | 61.6 | 94.7 | 3 | — | |
| FrozenPre-training Dataset=CC3M, WebVid-2.5M [3]2022.10 | 28.8 | 60.9 | — | 3 | — | |
| HD-VILAPre-training Dataset=HD-VILA-100M [54]2022.10 | 28.5 | 57.4 | 94 | 4 | — | |
| Clip4ClipPre-training Data=400M, GFLOPS=282, Evaluation Protocol=Zero-shot, Frames=322023.10 | 25 | 51.6 | — | — | 65.7 | |
| TeachText2023.10 | 23.5 | 57.2 | — | — | — | |
| All-in-one#PT Data=138M, #Frame=3, GFLOPS=622023.10 | 22.4 | 53.7 | — | — | 67.7 | |
| ClipBERTPre-training Dataset=COCO [9], Visual Genome [24]2022.10 | 21.3 | 49 | — | 6 | — | |
| ClipBERT#PT Data=0.2M, #Frame=2, GFLOPS=132023.10 | 21.3 | 49 | — | — | 63.5 | |
| HSE2022.10 | 20.5 | 49.3 | — | — | — |