Temporal Video Understanding on TVBench (test)
51.4AccuracyStructured Reward Reinforcement Learning
Evaluation Results
| Method | Links | |
|---|---|---|
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-32B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 51.4 | |
| Qwen3-VL-32BBackbone Model=Qwen3-VL-32B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 51.3 | |
| SeasonBackbone Model=Qwen3-VL-32B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 49.5 | |
| ArrowRLBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+ArrowRL, Model Access Level=Open-source2026.04 | 49.4 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 48.6 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-8B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 48 | |
| SeasonBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 47.7 | |
| Gemini 1.5 ProBackbone Model=Gemini 1.5 Pro, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 47.6 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-4B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 47.1 | |
| Qwen3-VL-8BBackbone Model=Qwen3-VL-8B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 47 | |
| DINO-HEALBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 46.9 | |
| SeasonBackbone Model=Qwen3-VL-8B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 46.8 | |
| Qwen2.5-VL-7BBackbone Model=Qwen2.5-VL-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 46.7 | |
| TCDBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 46.1 | |
| SeasonBackbone Model=Qwen3-VL-4B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 43.2 | |
| SeasonBackbone Model=LLaVA-OV-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 43 | |
| Structured Reward Reinforcement LearningBackbone Model=LLaVA-OV-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 43 | |
| TCDBackbone Model=LLaVA-OV-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 42.9 | |
| DINO-HEALBackbone Model=LLaVA-OV-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 42.9 | |
| LLaVA-OV-7BBackbone Model=LLaVA-OV-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 42.8 | |
| Qwen3-VL-4BBackbone Model=Qwen3-VL-4B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 41.7 | |
| GPT-4oBackbone Model=GPT-4o, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 39.9 |