Text-to-Video+Audio Retrieval on MSR-VTT
14.4R1MMT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MMTVision Encoder=Transformer, Input Modality=Text-video+audio, Evaluation Protocol=Zero-shot2023.10 | 14.4 | — | — | 66 | |
| HowToCaptionVision Encoder=S3D, Input Modality=Text-video+audio, Evaluation Protocol=Zero-shot2023.10 | 13.2 | 30.3 | 41.5 | 17 | |
| MCNVision Encoder=ResNet-152+ResNeXt101, Input Modality=Text-video+audio, Evaluation Protocol=Zero-shot2023.10 | 10.5 | 25.2 | 33.8 | — | |
| MIL-NCEVision Encoder=S3D, Input Modality=Text-video only, Evaluation Protocol=Zero-shot2023.10 | 9.9 | 24 | 32.4 | 29.5 | |
| EAOVision Encoder=S3D, Input Modality=Text-video+audio, Evaluation Protocol=Zero-shot2023.10 | 9.3 | 22.9 | 31.2 | 35 | |
| AVLNetVision Encoder=ResNet-152+ResNeXt101, Input Modality=Text-video+audio, Evaluation Protocol=Zero-shot2023.10 | 8.3 | 19.2 | 27.4 | 47 |