Text-to-video Retrieval on Charades (test)
26.7R@1T-MASS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| T-MASSBackbone=CLIP-ViT-B/16, Sampling trials=20, Batch size=32, Frame number=12, Resolution=224x2242024.03 | 26.7 | 30 | 51.7 | 63.9 | 5 | |
| X-PoolBackbone=CLIP-ViT-B/162024.03 | 20.7 | 47.4 | 42.5 | 53.5 | 9 | |
| SViTTArchitecture=Hybrid, PT=2M, T=8, Protocol=Fine-tuning2023.04 | 17.7 | 35.7 | — | — | — | |
| SViTTPT=2M, Frames=8, Sparsity=Hybrid, Fine-tuning=true2023.04 | 17.7 | 35.7 | 39.5 | 49.8 | — | |
| MKTVR+PT=400M, T=42, Protocol=Fine-tuning2023.04 | 16.6 | 34.7 | — | — | — | |
| MKTVR+PT=400M, Frames=42, Fine-tuning=true2023.04 | 16.6 | 34.7 | 37.5 | 50 | — | |
| SViTTArchitecture=Dense, PT=2M, T=8, Protocol=Fine-tuning2023.04 | 16 | 32.7 | — | — | — | |
| SViTTPT=2M, Frames=8, Sparsity=Dense, Fine-tuning=true2023.04 | 16 | 32.7 | 34.9 | 47.2 | — | |
| CLIP4ClipBackbone=CLIP-ViT-B/162024.03 | 16 | 54.1 | 38.2 | 48.5 | 12 | |
| ECLIPSEPT=400M, T=32, Protocol=Fine-tuning2023.04 | 15.7 | 30.3 | — | — | — | |
| ECLIPSEPT=400M, Frames=32, Fine-tuning=true2023.04 | 15.7 | 30.3 | 32.9 | 42.4 | — | |
| T-MASSBackbone=CLIP-ViT-B/32, Sampling trials=20, Batch size=32, Frame number=12, Resolution=224x2242024.03 | 14.2 | 54.8 | 36.2 | 48.3 | 12 | |
| CLIP4ClipPT=400M, T=12, Protocol=Fine-tuning2023.04 | 13.9 | 27.1 | — | — | — | |
| CLIP4ClipPT=400M, Frames=12, Fine-tuning=true2023.04 | 13.9 | 27.1 | 30.4 | 37.1 | — | |
| FrozenPT=5M, T=32, Protocol=Fine-tuning2023.04 | 11.9 | 25.1 | — | — | — | |
| FrozenPT=5M, Frames=32, Fine-tuning=true2023.04 | 11.9 | 25.1 | 28.3 | 35.1 | — | |
| X-PoolBackbone=CLIP-ViT-B/322024.03 | 11.2 | 82.7 | 28.3 | 38.8 | 20 | |
| CLIP4ClipBackbone=CLIP-ViT-B/322024.03 | 9.9 | 85.4 | 27.1 | 36.8 | 21 | |
| ClipBERTBackbone=CLIP-ViT-B/322024.03 | 6.7 | 149.7 | 17.3 | 25.2 | 32 |