Spatiotemporal-sensitive video understanding on DyBench
82.2AccuracyGemini-3.1-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-3.1-ProModel Type=Proprietary2026.05 | 82.2 | 71.7 | |
| Qwen3-VL-8B + CRPOBackbone=Qwen3-VL-8B, Post-training Method=CRPO2026.05 | 72.5 | 58.1 | |
| Qwen3-VL-8B + T-GRPOBackbone=Qwen3-VL-8B, Post-training Method=T-GRPO2026.05 | 70.9 | 54.5 | |
| Qwen3-VL-4B + CRPOBackbone=Qwen3-VL-4B, Post-training Method=CRPO2026.05 | 70.3 | 54.8 | |
| Qwen3-VL-8B + ArrowRLBackbone=Qwen3-VL-8B, Post-training Method=ArrowRL2026.05 | 69.6 | 52.2 | |
| InternVL3-8BModel Type=Open-Source2026.05 | 69.5 | 50.2 | |
| Qwen3-VL-8B + GRPOBackbone=Qwen3-VL-8B, Post-training Method=GRPO2026.05 | 69.4 | 52.4 | |
| Qwen3-VL-4B + T-GRPOBackbone=Qwen3-VL-4B, Post-training Method=T-GRPO2026.05 | 68.6 | 49.8 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B, Post-training Method=base2026.05 | 68.2 | 50.4 | |
| ArrowRL*Model Type=Open-Source2026.05 | 67.5 | 50.1 | |
| Qwen3-VL-4B + ArrowRLBackbone=Qwen3-VL-4B, Post-training Method=ArrowRL2026.05 | 66.7 | 47.5 | |
| Qwen3-VL-4B + GRPOBackbone=Qwen3-VL-4B, Post-training Method=GRPO2026.05 | 66.6 | 48.2 | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B, Post-training Method=base2026.05 | 65.1 | 45.4 | |
| Qwen2.5-VL-7BModel Type=Open-Source2026.05 | 64.5 | 44.1 | |
| GPT-5.1Model Type=Proprietary2026.05 | 63.7 | 44.9 | |
| LLaVA-OV-7BModel Type=Open-Source2026.05 | 48.4 | 19.6 |