Temporal Grounding on Charades-STA (R@0.3, R@0.5, R@0.7, mIoU)
63.7mIoUVideoAuto-R1
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| VideoAuto-R1Backbone=Qwen3-VL-8B2026.01 | 63.7 | 85.1 | 74.9 | 53.7 | — | — | — | |
| TempR1Type=RL, Zero-shot=false, fine-tuned on dataset=true2025.12 | 62.5 | — | — | — | 83 | 73.2 | 52.3 | |
| TempR1Type=RL, Zero-shot=false2025.12 | 61.4 | — | — | — | 83.2 | 72.7 | 51.2 | |
| TAR-TVGType=RL, Zero-shot=false, fine-tuned on dataset=true2025.12 | 61.1 | — | — | — | 83.6 | 71.4 | 50.2 | |
| VideoChat-R1Type=RL, Zero-shot=false2025.12 | 60.8 | — | — | — | — | 71.7 | 50.2 | |
| VideoChat-R1.52026.01 | 60.6 | 82.8 | 71.6 | 48.3 | — | — | — | |
| VideoChat-R1.5Type=RL, Zero-shot=false2025.12 | 60.6 | — | — | — | 82.8 | 71.6 | 48.3 | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B2026.01 | 60 | 82.9 | 70.8 | 46 | — | — | — | |
| VITAL2026.01 | 59.9 | 83.1 | 72 | 46.7 | — | — | — | |
| MUSEGType=RL, Zero-shot=false2025.12 | 59.7 | — | — | — | — | — | — | |
| Time-R12026.01 | 58.8 | 82.8 | 72.2 | 50.1 | — | — | — | |
| Time-R1Type=RL, Zero-shot=false, fine-tuned on dataset=true2025.12 | 58.8 | — | — | — | 82.8 | 72.2 | 50.1 | |
| Temporal-RLT2026.01 | 57 | 79.6 | 67.9 | 44.1 | — | — | — | |
| TimeThinkSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 55.3 | — | 64.1 | 38.1 | — | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, reproduced=true2026.01 | 52.9 | 77.7 | 59.6 | 34.8 | — | — | — | |
| GIRL-DETR2026.05 | 52.82 | — | — | — | 75.54 | 61.75 | 37.47 | |
| VanillaBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=100%, Reasoning=false2026.03 | 52.8 | 77.5 | 60.3 | 34.1 | — | — | — | |
| Qwen2.5-VL-GRPOSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 52.4 | — | 59.4 | 34.4 | — | — | — | |
| BAM-DETRVenue=ECCV242026.05 | 52.33 | — | — | — | 72.93 | 59.95 | 39.38 | |
| UniVTGType=VLP, Zero-shot=false2025.12 | 52.2 | — | — | — | 72.6 | 60.2 | 38.6 | |
| STCNetVenue=WWW232026.05 | 52.18 | — | — | — | — | 59.09 | 38.68 | |
| Qwen2.5-VL-SFTSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 51.8 | — | 58.1 | 33 | — | — | — | |
| Qwen2.5-VLSize=72B, Evaluation Protocol=Zero-Shot2026.07 | 50.9 | — | — | — | — | — | — | |
| RGTRVenue=AAAI252026.05 | 50.32 | — | — | — | 72.04 | 57.93 | 35.16 | |
| LLMEPETVenue=ACM MM242026.05 | 50.25 | — | — | — | 70.91 | — | 36.49 | |
| VideoMindSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 50.2 | — | 59.1 | 31.2 | — | — | — | |
| CG-DETRType=VLP, Zero-shot=false2025.12 | 50.1 | — | — | — | 70.4 | 58.4 | 36.3 | |
| UniVTGVenue=ICCV232026.05 | 50.1 | — | — | — | 70.81 | 58.01 | 35.65 | |
| CG-DETRVenue=PR252026.05 | 50.1 | — | — | — | 70.4 | 58.4 | 36.3 | |
| HawkEyeType=SFT, Zero-shot=false, fine-tuned on dataset=true2025.12 | 49.3 | — | — | — | 72.5 | 58.3 | 28.8 | |
| VideoAuto-R1 + ResAdaptBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=16.1%, Reasoning=true2026.03 | 49.1 | 72.8 | 53 | 27.5 | — | — | — | |
| TimeSearchSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 48.6 | — | 52.4 | 24.5 | — | — | — | |
| TimeMarker2026.01 | 48.4 | 73.5 | 51.9 | 26.9 | — | — | — | |
| TimeMarkerSize=8B, Evaluation Protocol=Zero-Shot2026.07 | 48.4 | — | 51 | 26.9 | — | — | — | |
| FlashVidBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=31.3%, Reasoning=false2026.03 | 47.7 | 72.9 | 52.3 | 25.1 | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=100%, Reasoning=false2026.03 | 47.3 | 71 | 51.4 | 26 | — | — | — | |
| VanillaBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=100%, Reasoning=false2026.03 | 46.4 | 73 | 49 | 21.4 | — | — | — | |
| VanillaBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=100%, Reasoning=false2026.03 | 45.6 | 72.8 | 46 | 20.1 | — | — | — | |
| Moment-DETRVenue=NeurIPS212026.05 | 45.54 | — | — | — | 65.83 | 52.07 | 30.59 | |
| UFVideoSize=7B2025.12 | 44.7 | 71.2 | 49.6 | 24.1 | — | — | — | |
| FlashVidBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=12.6%, Reasoning=false2026.03 | 44.6 | 68.8 | 46.9 | 22.9 | — | — | — | |
| VISDSetting=Zero-shot, Category=Grounded Reasoning Models2026.05 | 44.6 | 67.3 | 46.1 | 21.6 | — | — | — | |
| Qwen2.5-VLSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 43.6 | — | — | — | — | — | — | |
| ToMeBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=25.0%, Reasoning=false2026.03 | 43.1 | 68.7 | 42.1 | 17.6 | — | — | — | |
| VISIONCOACHZero-shot=true, Category=Grounded Reasoning Models2026.03 | 42.7 | 63.2 | 45.8 | 24.7 | — | — | — | |
| VisionCoachSetting=Zero-shot, Category=Grounded Reasoning Models2026.05 | 42.7 | 63.2 | 45.8 | 24.7 | — | — | — | |
| Open-o3-videoZero-shot=true, Category=Grounded Reasoning Models2026.03 | 42.5 | 62.6 | 45.6 | 24.5 | — | — | — | |
| Open-o3-videoSetting=Zero-shot, Category=Grounded Reasoning Models2026.05 | 42.5 | 62.6 | 45.6 | 24.5 | — | — | — | |
| LLaVA-STSize=7B2025.12 | 42.4 | 63.1 | 44.8 | 23.4 | — | — | — | |
| ResAdaptBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=16.1%, Reasoning=false2026.03 | 42 | 63.5 | 43.6 | 21.3 | — | — | — | |
| ToMeBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=10.0%, Reasoning=false2026.03 | 41.8 | 67.6 | 39.3 | 16.6 | — | — | — | |
| InternVideo2.5Size=7B2025.12 | 41.7 | — | 43.3 | — | — | — | — | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=100%, Reasoning=true2026.03 | 41.5 | 60 | 48.3 | 27.2 | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=16.2%, Reasoning=false2026.03 | 39.9 | 64.4 | 37.3 | 16.3 | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=16.1%, Reasoning=false2026.03 | 39.8 | 64.4 | 37 | 15.9 | — | — | — | |
| ToMeBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=10.0%, Reasoning=false2026.03 | 38.1 | 61.6 | 33.8 | 13.3 | — | — | — | |
| FixedScaleBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=12.3%, Reasoning=false2026.03 | 38.1 | 61.7 | 34.9 | 14.7 | — | — | — | |
| VideoChat-TPOSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 38.1 | — | 40.2 | 20.8 | — | — | — | |
| FixedScaleBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=12.3%, Reasoning=false2026.03 | 37.9 | 61.3 | 34.3 | 14.6 | — | — | — | |
| Grounded-VideoLLMSize=4B2025.12 | 36.8 | 54.2 | 36.4 | 19.7 | — | — | — | |
| GPT-4oEvaluation Protocol=Zero-Shot2026.07 | 35.7 | — | — | — | — | — | — | |
| ResAdaptBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=16.2%, Reasoning=false2026.03 | 35.6 | 53.8 | 34.8 | 17 | — | — | — | |
| ChatVTGSize=7B2025.12 | 34.9 | 52.7 | 33 | 15.9 | — | — | — | |
| ChatVTGType=SFT, Zero-shot=true2025.12 | 34.9 | — | — | — | 52.7 | 33 | 15.9 | |
| ChatVTGSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 34.9 | — | 33 | 15.9 | — | — | — | |
| HawkEyeSize=7B, Evaluation Protocol=Zero-Shot2026.07 | 34.7 | — | 31.4 | 14.5 | — | — | — | |
| VTimeLLMSize=13B2025.12 | 34.6 | 55.3 | 34.3 | 14.7 | — | — | — | |
| VTimeLLMSize=13B, Evaluation Protocol=Zero-Shot2026.07 | 34.6 | — | 34.3 | 14.7 | — | — | — | |
| VTG-LLMZero-shot=true, Category=Temporal Grounding Video LLM2026.03 | 34.4 | 51.2 | 33.8 | 15.7 | — | — | — | |
| VTG-LLMSetting=Zero-shot, Category=Temporal Grounding Video LLMs2026.05 | 34.4 | 51.2 | 33.8 | 15.7 | — | — | — | |
| VideoAuto-R1 + ResAdaptBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=6.8%, Reasoning=true2026.03 | 34.2 | 50.1 | 33.2 | 16.6 | — | — | — | |
| HawkEyeType=SFT, Zero-shot=true2025.12 | 33.7 | — | — | — | 50.6 | 31.4 | 14.5 | |
| HawkEyeZero-shot=true, Category=Temporal Grounding Video LLM2026.03 | 33.7 | 50.6 | 31.4 | 14.5 | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=6.8%, Reasoning=false2026.03 | 33.7 | 54.3 | 28 | 11.7 | — | — | — | |
| HawkEyeSetting=Zero-shot, Category=Temporal Grounding Video LLMs2026.05 | 33.7 | 50.6 | 31.4 | 14.5 | — | — | — | |
| ResAdaptBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=6.8%, Reasoning=false2026.03 | 33.6 | 53.6 | 29 | 11.8 | — | — | — | |
| FixedScaleBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=6.3%, Reasoning=false2026.03 | 33.6 | 53.7 | 28.2 | 11.8 | — | — | — | |
| FixedScaleBackbone=Qwen3-VL-8B, Frames=32, Retention Ratio R=6.3%, Reasoning=false2026.03 | 33.2 | 52.7 | 28.2 | 11.3 | — | — | — | |
| FixedScaleBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=12.3%, Reasoning=false2026.03 | 32 | 48 | 31.5 | 15.4 | — | — | — | |
| TimeChat2026.01 | 31.2 | 51 | 27.5 | 11.4 | — | — | — | |
| VTimeLLMType=SFT, Zero-shot=true2025.12 | 31.2 | — | — | — | 51 | 27.5 | 11.4 | |
| VTimeLLMZero-shot=true, Category=Temporal Grounding Video LLM2026.03 | 31.2 | 51 | 27.5 | 11.4 | — | — | — | |
| VTimeLLMSetting=Zero-shot, Category=Temporal Grounding Video LLMs2026.05 | 31.2 | 51 | 27.5 | 11.4 | — | — | — | |
| VideoAuto-R1 + ResAdaptBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=6.8%, Reasoning=true2026.03 | 30 | 43.5 | 30.1 | 15.8 | — | — | — | |
| Qwen-2.5-VL-7BType=SFT, Zero-shot=true2025.12 | 29.6 | — | — | — | 46.1 | 25.5 | 11.5 | |
| ResAdaptBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=6.8%, Reasoning=false2026.03 | 28.9 | 43.5 | 29.8 | 15 | — | — | — | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=100%, Reasoning=true2026.03 | 28.9 | 40.3 | 33.7 | 22.1 | — | — | — | |
| GroundingGPTSize=7B2025.12 | 28.7 | — | 29.6 | 11.9 | — | — | — | |
| MomentorSize=7B2025.12 | 28.5 | 42.6 | 26.6 | 11.6 | — | — | — | |
| MomentorZero-shot=true, Category=Temporal Grounding Video LLM2026.03 | 28.5 | 42.6 | 26.6 | 11.6 | — | — | — | |
| MomentorSetting=Zero-shot, Category=Temporal Grounding Video LLMs2026.05 | 28.5 | 42.6 | 26.6 | 11.6 | — | — | — | |
| FixedScaleBackbone=Qwen2.5-VL-7B, Frames=128, Retention Ratio R=6.3%, Reasoning=false2026.03 | 28.3 | 42.6 | 28.4 | 14.3 | — | — | — | |
| ToMeBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=10.0%, Reasoning=false2026.03 | 27.4 | 41.3 | 26.9 | 14.1 | — | — | — | |
| Random DropBackbone=Qwen3-VL-8B, Frames=128, Retention Ratio R=25.0%, Reasoning=false2026.03 | 27.4 | 41.6 | 25.2 | 10.6 | — | — | — | |
| ResAdaptBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=6.8%, Reasoning=false2026.03 | 27.2 | 41 | 27.8 | 14 | — | — | — | |
| FixedScaleBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=6.3%, Reasoning=false2026.03 | 26.7 | 39.9 | 26.8 | 13.3 | — | — | — | |
| FlashVidBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=31.3%, Reasoning=false2026.03 | 26.6 | 40.7 | 24.2 | 11.3 | — | — | — | |
| ToMeBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=25.0%, Reasoning=false2026.03 | 26 | 39.5 | 23.9 | 11.4 | — | — | — | |
| VideoChatSize=7B2025.12 | 25.9 | 32.8 | 8.6 | 0 | — | — | — | |
| Random DropBackbone=Qwen2.5-VL-7B, Frames=32, Retention Ratio R=25.0%, Reasoning=false2026.03 | 25.7 | 39.4 | 23.2 | 11 | — | — | — |