Temporal Video Question Answering on TimeLogic (test)
74.47Test AccuracyLeaderboard top
Evaluation Results
| Method | Links | |
|---|---|---|
| Leaderboard top2026.06 | 74.47 | |
| TLGBase=Qwen2.5-VL-32B, Symbolic Logic=Full, Frontier Model=Gemini-3.1-Pro on VLM-weak MC2026.06 | 71.37 | |
| Qwen2.5-VL-32B + CrossTask + AG + Breakfast + fixes + relaxed matchingBase=Qwen2.5-VL-32B, Symbolic Logic=Cumulative + relaxed STAR/AGQA matching2026.06 | 67.37 | |
| Qwen2.5-VL-32B + CrossTask + AG + Breakfast + coverage fixesBase=Qwen2.5-VL-32B, Symbolic Logic=Cumulative + coverage fixes (§3.3)2026.06 | 67.17 | |
| Qwen2.5-VL-32B + CrossTask + AG + Breakfast fine annotationsBase=Qwen2.5-VL-32B, Symbolic Logic=CrossTask + AG + Breakfast fine2026.06 | 64.77 | |
| Qwen2.5-VL-32B + CrossTask + Action Genome (STAR/AGQA)Base=Qwen2.5-VL-32B, Symbolic Logic=CrossTask + Action Genome (STAR/AGQA)2026.06 | 58.57 | |
| Qwen2.5-VL-32B + CrossTask symbolicBase=Qwen2.5-VL-32B, Symbolic Logic=CrossTask2026.06 | 56.93 | |
| Qwen2.5-VL-32BMode=holistic base2026.06 | 53.4 | |
| Qwen3-VL-8BPrompting=holistic, temporal prompt2026.06 | 46.9 |