Multi-modal Joint Retrieval on MSR-VTT
42Top-1 AccuracyLanguageBind
Evaluation Results
| Method | Links | |
|---|---|---|
| LanguageBindTask=Audio + Video to Text2023.10 | 42 | |
| LanguageBindTask=Video to Text2023.10 | 41.4 | |
| ImageBindTask=Audio + Video to Text2023.10 | 36.8 | |
| ImageBindTask=Video to Text2023.10 | 36.1 |