Spatio-Temporal Video Grounding on HC-STVG (val)
42.3Mean vIoUTCAM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TCAM2025.12 | 42.3 | — | 38.7 | 52.8 | |
| STVGFormerstatus=full model2022.07 | 38.7 | 65.5 | 33.8 | — | |
| STVGFormerinteraction=w/o d-to-s interaction2022.07 | 37.5 | 63.6 | 31.4 | — | |
| STVGFormerinteraction=w/o s-to-d interaction2022.07 | 37.1 | 62.3 | 30.2 | — | |
| TubeDETR2022.07 | 36.4 | 58.8 | 30.6 | — | |
| STVGFormerinteraction=w/o interaction2022.07 | 36.4 | 61.2 | 29.5 | — | |
| CG-STVGType=STVG method2025.12 | 34.8 | — | 31.5 | 47.2 | |
| STCATType=STVG method2025.12 | 31.2 | — | 28.3 | 44.6 | |
| Tan et al.ensemble=10 models2021.09 | 30.4 | 50.4 | 18.8 | — | |
| Aug. 2D-TAN2022.07 | 30.4 | 50.4 | 18.8 | — | |
| Our stage-1+MMNstage-1=Faster R-CNN + ACT + CSN, stage-2=MMN2021.09 | 30.32 | 49.02 | 25.56 | — | |
| MMN2022.07 | 30.3 | 49 | 25.6 | — | |
| Yu et al.2021.09 | 30.02 | — | — | — | |
| Yu et al.2022.07 | 30 | — | — | — | |
| TubeDETRType=STVG method2025.12 | 28.5 | — | 25.8 | 41.3 | |
| Our stage-1+2D-TANstage-1=Faster R-CNN + ACT + CSN, stage-2=2D-TAN2021.09 | 22.83 | 36.07 | 16.96 | — | |
| STVGBert2021.09 | 20.42 | 29.37 | 11.31 | — | |
| STGVTtraining set=smaller, reported in=Tang et al. 20202021.09 | 18.15 | 26.81 | 9.48 | — | |
| 2D-TAN + WSSTGtraining set=smaller, reported in=Tang et al. 20202021.09 | 15.43 | 19.83 | 6.81 | — |