Text-to-Video Retrieval on ActivityNet Caption (test)
0.614R@1CLIP-ViP
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CLIP-ViPBackbone=CLIP-ViT-B/16, Post-processing=DSL2022.09 | 0.614 | 0.857 | 0.926 | 0.01 | |
| CLIP-ViPBackbone=CLIP-ViT-B/32, Post-processing=DSL2022.09 | 0.591 | 0.839 | 0.913 | 0.01 | |
| CLIP-ViPBackbone=CLIP-ViT-B/162022.09 | 0.534 | 0.814 | 0.9 | 0.01 | |
| CLIP-ViPBackbone=CLIP-ViT-B/322022.09 | 0.511 | 0.784 | 0.883 | 0.01 | |
| CAMoEBackbone=CLIP-ViT-B/32, Post-processing=DSL2022.09 | 0.51 | 0.777 | — | — | |
| HiTeA# PT Data=17M, Inference Setting=Fine-tuning2022.12 | 0.497 | 0.771 | 0.867 | — | |
| CenterCLIPBackbone=CLIP-ViT-B/162022.09 | 0.462 | 0.77 | 0.876 | 0.02 | |
| DRLBackbone=CLIP-ViT-B/162022.09 | 0.462 | 0.773 | 0.882 | 0.02 | |
| HiTeA# PT Data=5M, Inference Setting=Fine-tuning2022.12 | 0.451 | 0.735 | 0.842 | — | |
| X-CLIP# PT Data=400M, Inference Setting=Fine-tuning2022.12 | 0.443 | 0.741 | — | — | |
| DRLBackbone=CLIP-ViT-B/322022.09 | 0.442 | 0.745 | 0.861 | 0.02 | |
| CLIP2TVBackbone=CLIP-ViT-B/322022.09 | 0.441 | 0.752 | — | 0.02 | |
| CenterCLIPBackbone=CLIP-ViT-B/322022.09 | 0.439 | 0.746 | 0.858 | 0.02 | |
| Singularity# PT Data=5M, Inference Setting=Fine-tuning2022.12 | 0.43 | 0.706 | 0.813 | — | |
| Clip4Clip# PT Data=400M, Inference Setting=Fine-tuning2022.12 | 0.405 | 0.724 | — | — | |
| CLIP4ClipBackbone=CLIP-ViT-B/322022.09 | 0.405 | 0.724 | — | 0.02 | |
| Support Set2022.09 | 0.292 | 0.616 | — | 0.03 | |
| Frozen2022.09 | 0.288 | 0.609 | — | 0.03 | |
| MMT2022.09 | 0.287 | 0.614 | — | 0.033 | |
| HD-VILA2022.09 | 0.285 | 0.574 | — | 0.04 | |
| All-in-one# PT Data=138M, Inference Setting=Fine-tuning2022.12 | 0.224 | 0.537 | 0.677 | — | |
| All-in-One2022.09 | 0.224 | 0.537 | 0.677 | 0.05 | |
| ClipBERT# PT Data=0.2M, Inference Setting=Fine-tuning2022.12 | 0.213 | 0.49 | 0.635 | — | |
| ClipBERT2022.09 | 0.213 | 0.49 | 0.635 | 0.06 |