Video Temporal Grounding on ActivityNet g43_s12 (test)
48.4Recall@0.5Qwen2-VL-7B + T2SGrid-FT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen2-VL-7B + T2SGrid-FTModel Category=General Vision-LLMs, Framework=T2SGrid-FT2026.03 | 48.4 | 64.4 | 29.5 | 46.7 | |
| TRACEModel Category=VTG-Tuned Vision-LLMs2026.03 | 37.7 | — | 24 | 39 | |
| NumProModel Category=VTG-Tuned Vision-LLMs2026.03 | 37.5 | 55.6 | 20.6 | 38.8 | |
| GPT-4o + T2SGridModel Category=General Vision-LLMs, Framework=T2SGrid2026.03 | 32.1 | 47.5 | 19.7 | 35.6 | |
| HawkEyeModel Category=VTG-Tuned Vision-LLMs2026.03 | 29.3 | 49.1 | 10.7 | 32.7 | |
| VTimeLLMModel Category=VTG-Tuned Vision-LLMs2026.03 | 27.8 | 44 | 14.3 | 30.4 | |
| Qwen2-VL-7B + T2SGridModel Category=General Vision-LLMs, Framework=T2SGrid2026.03 | 27.2 | 46.2 | 15.4 | 33.3 | |
| Qwen3-VL-8B + T2SGridModel Category=General Vision-LLMs, Framework=T2SGrid2026.03 | 26.8 | 44.8 | 16.1 | 32.5 | |
| MomentorModel Category=VTG-Tuned Vision-LLMs2026.03 | 26.6 | 42.6 | 11.6 | 28.5 | |
| Qwen3-VL-8BModel Category=General Vision-LLMs2026.03 | 26.2 | 39 | 15.8 | 29.3 | |
| LITAModel Category=VTG-Tuned Vision-LLMs2026.03 | 25.9 | — | — | 28.6 | |
| GPT-4oModel Category=General Vision-LLMs2026.03 | 21.2 | 33.3 | 10.4 | 23.7 | |
| LLaVA-OneVision-1.5-8B + T2SGridModel Category=General Vision-LLMs, Framework=T2SGrid2026.03 | 17.4 | 31.5 | 10.4 | 23.6 | |
| TimeChatModel Category=VTG-Tuned Vision-LLMs2026.03 | 16.9 | 30.2 | 8.2 | 21.8 | |
| Qwen2-VL-7BModel Category=General Vision-LLMs2026.03 | 9.4 | 17 | 3.9 | 12.5 | |
| LLaVA-OneVision-1.5-8BModel Category=General Vision-LLMs2026.03 | 4.9 | 9.2 | 2.1 | 7.5 |