Spatio-temporal Video Grounding on HC-STVG 1.0 (test)
32.4m_vIoUTubeDETR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TubeDETRPretraining Data=ImageNet + Visual Genome + Flickr + COCO2022.03 | 32.4 | 49.8 | 23.5 | |
| TubeDETRPretraining Data=ImageNet2022.03 | 21.2 | 31.6 | 12.2 | |
| STVGBertPretraining Data=ImageNet + Visual Genome + Conceptual Captions2022.03 | 20.4 | 29.4 | 11.3 | |
| STGVTPretraining Data=Visual Genome + Conceptual Captions2022.03 | 18.2 | 26.8 | 9.5 |