Video Temporal Grounding on ActivityNet-Captions
69.8Recall @ IoU=0.3Factum-4B
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Factum-4BSource Type=Open-Source, FPS=1fps2026.04 | 69.8 | 48.4 | 28.1 | — | — | — | — | — | — | |
| MMNFT=true2025.03 | 64.5 | 48.2 | 29.4 | 46.6 | — | — | — | — | — | |
| Qwen3-VL-8B + F2G-FTBackbone=Qwen3-VL-8B-Instruct, Evaluation Protocol=Foresee-to-Ground fine-tuning2026.05 | 63.8 | 46.1 | 28.4 | 45.7 | — | — | — | — | — | |
| EvoGroundLearning Protocol=RL-based, Model Scale=7B, Backbone=Qwen2.5-VL-7B2026.05 | 62.9 | — | — | 43.9 | — | 43.6 | 25 | — | — | |
| TARZero-shot=true, Parameters=7B2025.08 | 61.5 | — | — | 41.1 | — | 39.8 | 19.8 | — | — | |
| 2D-TANFT=true2025.03 | 60.4 | 43.4 | 25 | 42.5 | — | — | — | — | — | |
| Time-R1Learning Protocol=RL-based, Model Scale=7B2026.05 | 58.6 | — | — | 40.5 | — | 39 | 21.4 | — | — | |
| Time-R1Zero-shot=true, Parameters=7B2025.08 | 58.6 | — | — | — | — | 39 | 21.4 | — | — | |
| Qwen3-VL-8B + FTBackbone=Qwen3-VL-8B-Instruct, Evaluation Protocol=Fine-tuning2026.05 | 58.4 | 39.2 | 21.7 | 40.8 | — | — | — | — | — | |
| Time-R1-7BSource Type=Open-Source, FPS=2fps2026.04 | 58.1 | 39 | 21.4 | — | — | — | — | — | — | |
| NumProBackbone=LongVA-7B-DPO2026.05 | 55.6 | 37.5 | 20.6 | 38.8 | — | — | — | — | — | |
| TRACE-7BSource Type=Open-Source, FPS=2fps2026.04 | 54 | 37.7 | 24 | — | — | — | — | — | — | |
| VideoChat-R1.5Learning Protocol=RL-based, Model Scale=7B2026.05 | 52.4 | — | — | 35.5 | — | 32.3 | 16.8 | — | — | |
| VideoChat-R1.5Zero-shot=true, Parameters=7B2025.08 | 52.4 | — | — | 35.5 | — | 32.3 | 16.8 | — | — | |
| ED-VTGLearning Protocol=SFT-based, Model Scale=7B2026.05 | 52.1 | — | — | 35.2 | — | 33.1 | 16 | — | — | |
| Gemini-2.5-FlashSource Type=Close-Source, FPS=2fps2026.04 | 51.2 | 34.7 | 21 | — | — | — | — | — | — | |
| Gemini-2.0-FlashSource Type=Close-Source, FPS=2fps2026.04 | 50.4 | 33.2 | 19.9 | — | — | — | — | — | — | |
| VideoChat-R1Learning Protocol=RL-based, Model Scale=7B2026.05 | 50.4 | — | — | 34.3 | — | 32.2 | 16.2 | — | — | |
| Qwen3-VL-4B-InstructSource Type=Open-Source, FPS=1fps, reproducibility=Reproduced under same video settings2026.04 | 50.2 | 35.8 | 21.6 | — | — | — | — | — | — | |
| HawkEyeLearning Protocol=SFT-based, Model Scale=7B2026.05 | 49.1 | — | — | — | — | 29.3 | 10.7 | — | — | |
| HawkEyeBackbone=-2026.05 | 49.1 | 29.3 | 10.7 | 32.7 | — | — | — | — | — | |
| HawkEyeZero-shot=true, Parameters=7B2025.08 | 49.1 | — | — | — | — | 29.3 | 10.7 | — | — | |
| VideoMindSize=7B, FT=false2025.03 | 48.4 | 30.3 | 15.7 | 33.3 | — | — | — | — | — | |
| Qwen3-VL-4B-ThinkingSource Type=Open-Source, FPS=1fps, reproducibility=Reproduced under same video settings2026.04 | 47.8 | 31.7 | 19 | — | — | — | — | — | — | |
| VTimeLLMBackbone=CLIP ViT-L/14 + Vicuna-13B2026.05 | 44.8 | 29.5 | 14.2 | 31.4 | — | — | — | — | — | |
| VideoMindSize=2B, FT=false2025.03 | 44 | 26.5 | 12.6 | 30.1 | — | — | — | — | — | |
| VTimeLLMLearning Protocol=SFT-based, Model Scale=7B2026.05 | 44 | — | — | 30.4 | — | 27.8 | 14.3 | — | — | |
| VTime-LLMZero-shot=true, Parameters=7B2025.08 | 44 | — | — | — | — | 27.8 | 14.3 | — | — | |
| Grounded-VideoLLMLearning Protocol=SFT-based, Model Scale=7B2026.05 | 43.9 | — | — | 34.5 | — | 29.1 | 18.3 | — | — | |
| MomentorSize=7B, FT=false2025.03 | 42.9 | 23 | 12.4 | 29.3 | — | — | — | — | — | |
| MomentorLearning Protocol=SFT-based, Model Scale=7B2026.05 | 42.9 | — | — | 29.3 | — | 23 | 12.4 | — | — | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B-Instruct2026.05 | 42.8 | 27.8 | 17.3 | 32.2 | — | — | — | — | — | |
| MomentorBackbone=CLIP ViT-L4 + LLaMA-7B2026.05 | 42.6 | 26.6 | 11.6 | 28.5 | — | — | — | — | — | |
| ChatVTGSize=7B, FT=false2025.03 | 40.7 | 22.5 | 9.4 | 27.2 | — | — | — | — | — | |
| ChatVTGZero-shot=true, Parameters=7B2025.08 | 40.7 | — | — | 27.2 | — | 22.5 | 9.4 | — | — | |
| Qwen2.5-VL*Learning Protocol=SFT-based, Model Scale=7B, Reproduced=true2026.05 | 38.7 | — | — | 28.6 | — | 25.6 | 14.9 | — | — | |
| TimeChatLearning Protocol=SFT-based, Model Scale=7B2026.05 | 36.2 | — | — | 21.8 | — | 20.2 | 9.5 | — | — | |
| TimeChatZero-shot=true, Parameters=7B2025.08 | 36.2 | — | — | — | — | 20.2 | 9.5 | — | — | |
| Qwen2.5-VL-7BSource Type=Open-Source, FPS=2fps2026.04 | 34.5 | 20.8 | 11.2 | — | — | — | — | — | — | |
| ValleySize=7B, FT=false2025.03 | 30.6 | 13.7 | 8.1 | 21.9 | — | — | — | — | — | |
| TimeChatBackbone=ViT-G/14 + LLaMA-2-7B2026.05 | 30.2 | 16.9 | 8.2 | 21.8 | — | — | — | — | — | |
| Video-ChatGPTSize=7B, FT=false2025.03 | 26.4 | 13.6 | 6.1 | 18.9 | — | — | — | — | — | |
| Video-ChatGPTZero-shot=true, Parameters=7B2025.08 | 26.4 | — | — | 18.9 | — | 13.6 | 6.1 | — | — | |
| E.T. ChatSize=4B, FT=false2025.03 | 24.1 | 12.8 | 6.1 | 18.9 | — | — | — | — | — | |
| VideoChatSize=7B, FT=false2025.03 | 8.8 | 3.7 | 1.5 | 7.2 | — | — | — | — | — | |
| VideoChatZero-shot=true, Parameters=7B2025.08 | 8.8 | — | — | 7.2 | — | 3.7 | 1.5 | — | — | |
| Video-LLaMASize=7B, FT=false2025.03 | 6.9 | 2.1 | 0.8 | 6.5 | — | — | — | — | — | |
| 2D-TANShared Weights=false2026.04 | — | 46.16 | 29.21 | — | 37.69 | — | — | — | — | |
| Contrastive-MSAT2024.12 | — | — | — | — | — | 47.73 | 31.21 | 78.06 | 63.63 | |
| ED-VTG-7BShared Weights=true2026.04 | — | 45.1 | 22.7 | — | 33.9 | — | — | — | — | |
| G2L2024.12 | — | — | — | — | — | 51.68 | 33.35 | 81.32 | 67.6 | |
| HawkEye-7BShared Weights=true2026.04 | — | 34.7 | 17.9 | — | 26.3 | — | — | — | — | |
| LITABackbone=CLIP ViT-L/14 + Vicuna-7B2026.05 | — | 25.9 | — | 28.6 | — | — | — | — | — | |
| MGSL-Net2024.12 | — | — | — | — | — | 51.87 | 31.42 | 82.6 | 66.71 | |
| MMN2024.12 | — | — | — | — | — | 48.59 | 29.26 | 79.5 | 64.76 | |
| Multi-Scale Contrastive Learning2024.12 | — | — | — | — | — | 54.83 | 33.56 | 84.78 | 68.91 | |
| Qwen2.5-VL-7BShared Weights=true2026.04 | — | 16.96 | 8.75 | — | 12.86 | — | — | — | — | |
| Qwen2.5vlBackbone=Qwen2.5vl, Evaluation Strategy=w. SFT2025.10 | — | 16.5 | 7.8 | — | — | — | — | — | — | |
| Qwen2.5vl (w. TCAS)Backbone=Qwen2.5vl, Evaluation Strategy=w. TCAS2025.10 | — | 16.5 | 7.9 | — | — | — | — | — | — | |
| SnAGShared Weights=false2026.04 | — | 48.55 | 30.56 | — | 39.56 | — | — | — | — | |
| SnAG2024.12 | — | — | — | — | — | 48.55 | 30.56 | 81.71 | 63.41 | |
| SSRN2024.12 | — | — | — | — | — | 54.49 | 33.15 | 84.72 | 68.48 | |
| Temporal-RLTZero-shot=true, Parameters=7B2025.08 | — | — | — | 39 | — | — | — | — | — | |
| UniTime-7BShared Weights=true2026.04 | — | 53.67 | 35.9 | — | 44.79 | — | — | — | — | |
| UniversalVTGShared Weights=true2026.04 | — | 48.98 | 29.79 | — | 39.39 | — | — | — | — | |
| UniVTGShared Weights=true2026.04 | — | 42.41 | 21.55 | — | 31.98 | — | — | — | — | |
| UnLoc-LShared Weights=false2026.04 | — | 48.3 | 30.2 | — | 39.25 | — | — | — | — | |
| VDIFT=true2025.03 | — | 48.1 | 28.8 | — | — | — | — | — | — | |
| VideoChat-R1-7BSource Type=Open-Source, FPS=2fps2026.04 | — | 33.3 | 16.7 | — | — | — | — | — | — | |
| videollamaBackbone=videollama, Evaluation Strategy=w. SFT2025.10 | — | 34.3 | 19.1 | — | — | — | — | — | — | |
| videollama (w. TCAS)Backbone=videollama, Evaluation Strategy=w. TCAS2025.10 | — | 35.2 | 20 | — | — | — | — | — | — | |
| VLG-NET2024.12 | — | — | — | — | — | 46.32 | 29.82 | 77.15 | 63.33 |