Video Reasoning on VSIBench
48.8ScoreGemini-1.5-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-1.5-ProSize=-, Zero-shot=true, Category=Proprietary Models2026.07 | 48.8 | — | |
| InternVL2.5Size=8B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 38.9 | — | |
| TimeThinkSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 37.8 | — | |
| Qwen-2.5-VLSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 37.7 | — | |
| Video-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 37.1 | — | |
| VideoRFTSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 36.8 | — | |
| Qwen2.5-VL-GRPOSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 36.7 | — | |
| VideoChat-R1.5Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 36.1 | — | |
| Qwen2.5-VL-SFTSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 34.8 | — | |
| GPT-4oSize=-, Zero-shot=true, Category=Proprietary Models2026.07 | 34 | — | |
| VideoChat-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 33 | — | |
| LLaVA-OVSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 32.4 | — | |
| VILA-1.5Size=40B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 31.2 | — | |
| GPT-4oCategory=Proprietary LMMs2026.04 | — | 34 | |
| InternVL2.5-8BCategory=Open-Source LMMs2026.04 | — | 41.6 | |
| LLaVA-OneVision-7BCategory=Open-Source LMMs2026.04 | — | 32.4 | |
| LLaVA-Video-7BCategory=Open-Source LMMs2026.04 | — | 35.7 | |
| Qwen2.5-VL-7BCategory=Open-Source LMMs2026.04 | — | 37.4 | |
| RLERCategory=RL-based LMMs2026.04 | — | 43.3 | |
| STAR-R1Category=RL-based LMMs2026.04 | — | 34.1 | |
| Video-R1Category=RL-based LMMs2026.04 | — | 35.8 | |
| VideoRFTCategory=RL-based LMMs2026.04 | — | 36.8 | |
| VILA-1.5-8BCategory=Open-Source LMMs2026.04 | — | 28.9 |