Spatiotemporal-sensitive video understanding on TimeBlind
77.2AccuracyGemini-3.1-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-3.1-ProModel Type=Proprietary2026.05 | 77.2 | 45.5 | |
| Qwen3-VL-8B + CRPOBackbone=Qwen3-VL-8B, Post-training Method=CRPO2026.05 | 71.7 | 36 | |
| Qwen3-VL-8B + T-GRPOBackbone=Qwen3-VL-8B, Post-training Method=T-GRPO2026.05 | 70.3 | 32.5 | |
| Qwen3-VL-4B + CRPOBackbone=Qwen3-VL-4B, Post-training Method=CRPO2026.05 | 69.8 | 31.7 | |
| Qwen3-VL-8B + GRPOBackbone=Qwen3-VL-8B, Post-training Method=GRPO2026.05 | 69.8 | 30.5 | |
| Qwen3-VL-8B + ArrowRLBackbone=Qwen3-VL-8B, Post-training Method=ArrowRL2026.05 | 69.3 | 29.3 | |
| Qwen3-VL-4B + T-GRPOBackbone=Qwen3-VL-4B, Post-training Method=T-GRPO2026.05 | 67.9 | 29 | |
| Qwen3-VL-4B + GRPOBackbone=Qwen3-VL-4B, Post-training Method=GRPO2026.05 | 67.8 | 28 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B, Post-training Method=base2026.05 | 67.8 | 27.8 | |
| Qwen3-VL-4B + ArrowRLBackbone=Qwen3-VL-4B, Post-training Method=ArrowRL2026.05 | 67.5 | 26.8 | |
| GPT-5.1Model Type=Proprietary2026.05 | 67.3 | 27 | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B, Post-training Method=base2026.05 | 66.2 | 26.5 | |
| Qwen2.5-VL-7BModel Type=Open-Source2026.05 | 65 | 22.5 | |
| ArrowRL*Model Type=Open-Source2026.05 | 65 | 20.2 | |
| InternVL3-8BModel Type=Open-Source2026.05 | 63 | 18.3 | |
| LLaVA-OV-7BModel Type=Open-Source2026.05 | 56.5 | 7.8 |