Spatio-temporal Video Grounding on VidSTG Interrogative Sentences (test)
31.3m_vIoUBridge-STG
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Bridge-STGModel Category=7B-based MLLMs2026.04 | 31.3 | 50.1 | 43.8 | 31.2 | — | |
| TA-STVG2025.02 | 29.5 | 50.2 | 41.5 | 28 | — | |
| TA-STVGModel Category=Non-generative and task-specific models2026.04 | 29.5 | 50.2 | 41.5 | 28 | — | |
| CG-STVG2024.01 | 29 | 49.9 | 40.5 | 27.5 | — | |
| CG-STVG2025.02 | 29 | 49.9 | 40.5 | 27.5 | — | |
| CG-STVGModel Category=Non-generative and task-specific models2026.04 | 29 | 49.9 | 40.5 | 27.5 | — | |
| CSDVL2024.01 | 28.5 | — | 39.9 | 26.2 | — | |
| STVGFormer2025.02 | 28.5 | — | 39.9 | 26.2 | — | |
| STCATArchitecture Type=One-Stage2022.09 | 28.22 | 49.67 | 39.24 | 26.63 | — | |
| STCAT2024.01 | 28.2 | 49.7 | 39.2 | 26.6 | — | |
| STCAT2025.02 | 28.2 | 49.7 | 39.2 | 26.6 | — | |
| Baseline2024.01 | 27.7 | 48.8 | 38.7 | 25.6 | — | |
| Baseline2025.02 | 27.5 | 48.6 | 38.5 | 25.6 | — | |
| NSTTuning Strategy=Null-Space Tuning2026.06 | 26.49 | 49.47 | 36.9 | 23.29 | — | |
| SGFDN2025.02 | 25.8 | 44.8 | 36.9 | 23.9 | — | |
| TubeDETRPretraining Data=ImageNet + Visual Genome + Flickr + COCO2022.03 | 25.7 | 46.9 | 35.7 | 23.2 | — | |
| TubeDETRArchitecture Type=One-Stage2022.09 | 25.7 | 46.9 | 35.7 | 23.2 | — | |
| TubeDETR2024.01 | 25.7 | 46.9 | 35.7 | 23.2 | — | |
| TubeDETR2025.02 | 25.7 | 46.9 | 35.7 | 23.2 | — | |
| TubeDETRModel Category=Non-generative and task-specific models2026.04 | 25.7 | 46.9 | 35.7 | 23.2 | — | |
| FlyLoRATuning Strategy=PEFT2026.06 | 25.67 | 49.03 | 35.94 | 22.19 | — | |
| DoRATuning Strategy=PEFT2026.06 | 25.54 | 48.81 | 35.63 | 22.28 | — | |
| SpaceVLLMModel Category=7B-based MLLMs2026.04 | 25.4 | 48.5 | 35.9 | 22.2 | — | |
| AdaLoRATuning Strategy=PEFT2026.06 | 25.29 | 48.67 | 35.26 | 21.84 | — | |
| LoRATuning Strategy=PEFT2026.06 | 25.03 | 48.54 | 34.97 | 21.51 | — | |
| Full-FinetuneTuning Strategy=Full Fine-tune2026.06 | 24.38 | 48.38 | 34.42 | 21.03 | — | |
| BaselineTuning Strategy=Baseline2026.06 | 24.26 | 48.69 | 34.04 | 20.76 | — | |
| STVGBertArchitecture Type=One-Stage2022.09 | 22.51 | — | 25.97 | 15.95 | — | |
| STVGBertPretraining Data=ImageNet + Visual Genome + Conceptual Captions2022.03 | 22.5 | — | 26 | 16 | — | |
| STVGBert2024.01 | 22.5 | — | 26 | 16 | — | |
| STVGBert2025.02 | 22.5 | — | 26 | 16 | — | |
| OMRNArchitecture Type=Two-Stage2022.09 | 20.63 | 49.19 | 28.35 | 14.11 | — | |
| OMRN2024.01 | 20.6 | 49.2 | 28.4 | 14.1 | — | |
| OMRN2025.02 | 20.6 | 49.2 | 28.4 | 14.1 | — | |
| TubeDETRPretraining Data=ImageNet2022.03 | 19.6 | 42.3 | 26.1 | 14.9 | — | |
| STGRNArchitecture Type=Two-Stage2022.09 | 18.32 | 46.98 | 21.1 | 12.83 | — | |
| STGRNPretraining Data=Visual Genome2022.03 | 18.3 | 47 | 21.1 | 12.8 | — | |
| STGRN2024.01 | 18.3 | 47 | 21.1 | 12.8 | — | |
| STGRN2025.02 | 18.3 | 47 | 21.1 | 12.8 | — | |
| WSSTG+L-NetArchitecture Type=Factorized2022.09 | 13.36 | 39.79 | 17.39 | 7.06 | — | |
| STPR+L-NetArchitecture Type=Factorized2022.09 | 11.94 | 39.79 | 14.73 | 5.27 | — | |
| VideoMolmoModel Category=7B-based MLLMs2026.04 | 11.7 | 30.2 | 15.2 | 7.3 | — | |
| LLaVA-STModel Category=7B-based MLLMs2026.04 | 11.5 | 42.9 | 14.3 | 5.9 | — | |
| GroundeR+L-NetArchitecture Type=Factorized2022.09 | 11.05 | 39.79 | 14.28 | 5.11 | — | |
| WSSTG+TALLArchitecture Type=Factorized2022.09 | 10.65 | 33.73 | 13.9 | 5.32 | — | |
| STPR+TALLArchitecture Type=Factorized2022.09 | 9.98 | 33.73 | 11.74 | 4.36 | — | |
| GroundeR+TALLArchitecture Type=Factorized2022.09 | 9.32 | 33.73 | 11.39 | 3.24 | — | |
| GLaMM + SAM22024.11 | — | — | — | — | 38.63 | |
| PG-Video-LLaVAModel size=7B2024.11 | — | — | — | — | 34.2 | |
| PG-Video-LLaVAModel size=13B2024.11 | — | — | — | — | 35.1 | |
| VideoGLaMM2024.11 | — | — | — | — | 39.66 |