Temporal Clip Retrieval (Video-to-Text) on YouCook
50Recall@5ViT3D
Evaluation Results
| Method | Links | |
|---|---|---|
| ViT3DTraining subset=4M, Inference frames=162025.05 | 50 | |
| TrajViTTraining subset=4M, Inference frames=162025.05 | 50 | |
| TokenLearnerTraining subset=4M, Inference frames=162025.05 | 49.8 | |
| RLTTraining subset=4M, Inference frames=162025.05 | 49.4 | |
| ViViTTraining subset=4M, Inference frames=162025.05 | 48.8 | |
| ToMeTraining subset=4M, Inference frames=162025.05 | 48.2 | |
| AutoMergeTraining subset=4M, Inference frames=162025.05 | 47.8 |