Video Temporal Grounding on Charades-STA (R1@0.3, R1@0.5, R1@0.7, mIoU)
67.8R1@0.5 RecallTaRO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TaROSize=8B, Base Model=Qwen3-VL-8B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 67.8 | 83.2 | 41.9 | — | |
| TaROSize=7B, Base Model=Qwen2.5-VL-7B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 64.8 | 79.7 | 38.4 | — | |
| MASRAFeatures=SF+C2026.05 | 61.08 | 72.01 | 38.75 | 51.22 | |
| Time-R1Learning Protocol=RL-based, Model Scale=7B2026.05 | 60.8 | 78.1 | 35.3 | 58.1 | |
| Time-R1Size=7B, Base Model=Qwen2.5-VL-7B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 60.8 | 78.1 | 35.3 | — | |
| EvoGroundLearning Protocol=RL-based, Model Scale=7B, Backbone=Qwen2.5-VL-7B2026.05 | 60.5 | 77.2 | 35.5 | 53.1 | |
| KDAFeatures=SF+C2026.05 | 60.23 | — | 37.63 | — | |
| UVCOMFeatures=SF+C2026.05 | 59.25 | — | 36.64 | — | |
| UniTimeSize=7B, Base Model=Qwen2.5-VL-7B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 59.1 | — | 31.9 | — | |
| CG-DETRFeatures=SF+C2026.05 | 58.44 | 70.43 | 36.34 | 50.13 | |
| UniVTGFeatures=SF+C2026.05 | 58.01 | 70.81 | 35.65 | 50.1 | |
| RGTRFeatures=SF+C2026.05 | 57.93 | 72.04 | 35.16 | 50.32 | |
| Qwen3-VL-8B-ThinkSize=8B, Base Model=Qwen3-VL-8B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 57.9 | 72.7 | 32.6 | — | |
| QD-DETRSupervised=true2026.07 | 57.3 | — | 32.6 | — | |
| MTLABackbone=Qwen3-VL-8B, Zero-shot=true, N=162026.07 | 55.4 | 76.3 | 29.4 | — | |
| TaROSize=3B, Base Model=Qwen2.5-VL-3B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 55.2 | 75.1 | 28.6 | — | |
| Qwen2.5-VL-7B-InstructSize=7B, Base Model=Qwen2.5-VL-7B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 53.6 | 72.5 | 28.5 | — | |
| VideoChat-FlashSize=7B, Evaluation Protocol=Zero-shot2026.06 | 53.1 | 74.5 | 27.6 | — | |
| Time-R1Size=3B, Base Model=Qwen2.5-VL-3B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 53.1 | 74.6 | 26 | — | |
| Moment-DETRSupervised=true2026.07 | 52.1 | 65.8 | 30.6 | — | |
| M-DETRFeatures=SF+C2026.05 | 52.07 | 65.83 | 30.59 | 45.54 | |
| Qwen3-VL-8B-InstructSize=8B, Base Model=Qwen3-VL-8B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 49.8 | 72.7 | 21.3 | — | |
| Qwen2.5-VL*Learning Protocol=SFT-based, Model Scale=7B, Reproduced=true2026.05 | 48.8 | 68.5 | 22.5 | 45 | |
| TimeSuiteLearning Protocol=SFT-based, Model Scale=7B2026.05 | 48.7 | 69.9 | 24 | — | |
| TimeSuiteSize=7B, Evaluation Protocol=Zero-shot2026.06 | 48.7 | 69.9 | 24 | — | |
| 2D-TANFeatures=SF+C2026.05 | 46.02 | 58.76 | 27.5 | 41.25 | |
| raw predictionsBackbone=Qwen3-VL-8B, Zero-shot=true, N=12026.07 | 44 | 68 | 18.8 | — | |
| SVARBackbone=Qwen3-VL-8B, Zero-shot=true, N=162026.07 | 43.8 | 68.8 | 18.9 | — | |
| VSLNetFeatures=SF+C2026.05 | 42.69 | 60.3 | 24.14 | 41.58 | |
| Qwen2.5-VL-3B-InstructSize=3B, Base Model=Qwen2.5-VL-3B-Instruct, Evaluation Protocol=Zero-shot2026.06 | 42 | 62.1 | 20.1 | — | |
| TRACELearning Protocol=SFT-based, Model Scale=7B2026.05 | 40.3 | 58.6 | 19.4 | 38.7 | |
| TRACESize=7B, Evaluation Protocol=Zero-shot2026.06 | 40.3 | — | 19.4 | — | |
| ED-VTGLearning Protocol=SFT-based, Model Scale=7B2026.05 | 39.3 | 59.5 | 19.8 | 40.2 | |
| Grounded-VideoLLMLearning Protocol=SFT-based, Model Scale=7B2026.05 | 34.3 | 51.8 | 18.3 | 34.7 | |
| ChatVTGSize=7B, Evaluation Protocol=Zero-shot2026.06 | 33 | 52.7 | 15.9 | — | |
| TimeChatLearning Protocol=SFT-based, Model Scale=7B2026.05 | 32.2 | — | 13.4 | 32.2 | |
| TimeChatSize=7B, Evaluation Protocol=Zero-shot2026.06 | 32.2 | — | 13.4 | — | |
| HawkEyeLearning Protocol=SFT-based, Model Scale=7B2026.05 | 31.4 | 50.6 | 14.5 | — | |
| HawkEyeSize=7B, Evaluation Protocol=Zero-shot2026.06 | 31.4 | 50.6 | 14.5 | — | |
| VTimeLLMLearning Protocol=SFT-based, Model Scale=7B2026.05 | 27.5 | 51 | 11.4 | 31.2 | |
| VTimeLLMSize=7B, Evaluation Protocol=Zero-shot2026.06 | 27.5 | 51 | 11.4 | — | |
| MomentorLearning Protocol=SFT-based, Model Scale=7B2026.05 | 26.6 | 42.6 | 11.6 | 28.5 |