Spatial Reasoning on VSTI-Bench
24.4Cam. Mov. Dir. ErrorGemini-1.5 Flash
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Gemini-1.5 Flash2026.02 | 24.4 | 32.1 | 28.5 | 20.9 | 52.6 | 33.9 | |
| Gemini-1.5 FlashCategory=Proprietary Models (API)2026.05 | 24.4 | 32.1 | 28.5 | 20.9 | 52.6 | 33.9 | |
| VILA-1.5Parameters=40B2026.02 | 28.8 | 38.2 | 28.2 | 15.7 | 65.4 | 53 | |
| VILA-1.5-40BCategory=Open-sourced VLMs, Parameters=40B2026.05 | 28.8 | 38.2 | 28.2 | 15.7 | 65.4 | 53 | |
| LongVILAParameters=8B2026.02 | 35.4 | 30.5 | 20 | 11.6 | 52.3 | 33.4 | |
| LongVILA-8BCategory=Open-sourced VLMs, Parameters=8B2026.05 | 35.4 | 30.5 | 20 | 11.6 | 52.3 | 33.4 | |
| Chance Level (Random)2026.02 | 36.1 | — | — | — | 50 | 36.1 | |
| GPT-4o2026.02 | 37.3 | 38.2 | 29.5 | 23.4 | 58.1 | 42.5 | |
| GPT-4oCategory=Proprietary Models (API)2026.05 | 37.3 | 38.2 | 29.5 | 23.4 | 58.1 | 42.5 | |
| Chance Level (Frequency)2026.02 | 40.7 | 27.4 | 5.4 | 6.2 | 52.2 | 32.4 | |
| VILA-1.5Parameters=8B2026.02 | 42.2 | 37.3 | 30.1 | 27.3 | 50.4 | 36.7 | |
| VILA-1.5-8BCategory=Open-sourced VLMs, Parameters=8B2026.05 | 42.2 | 37.3 | 30.1 | 27.3 | 50.4 | 36.7 | |
| InternVL2Parameters=2B2026.02 | 43 | 38.1 | 17.7 | 27.8 | 54.9 | 47.2 | |
| LongVAParameters=7B2026.02 | 43.7 | 32.3 | 13.5 | 5.1 | 57.9 | 41.2 | |
| LongVA-7BCategory=Open-sourced VLMs, Parameters=7B2026.05 | 43.7 | 32.3 | 13.5 | 5.1 | 57.9 | 41.2 | |
| LLaVA-OneVisionParameters=0.5B2026.02 | 46.1 | 36.9 | 16.5 | 32.4 | 50.5 | 39 | |
| LLaVA-OneVisionParameters=7B2026.02 | 47.5 | 41.7 | 29.9 | 19.3 | 62.1 | 49.8 | |
| LLaVA-OneVision-7BCategory=Open-sourced VLMs, Parameters=7B2026.05 | 47.5 | 41.7 | 29.9 | 19.3 | 62.1 | 49.8 | |
| InternVL2Parameters=8B2026.02 | 48 | 43.5 | 32.9 | 13.5 | 68 | 55 | |
| InternVL2-8BCategory=Open-sourced VLMs, Parameters=8B2026.05 | 48 | 43.5 | 32.9 | 13.5 | 68 | 55 | |
| LLaVA-NeXT-VideoParameters=72B2026.02 | 48.1 | 44 | 32.3 | 10.5 | 78.3 | 50.9 | |
| LLaVA-NeXT-Video-72BCategory=Open-sourced VLMs, Parameters=72B2026.05 | 48.1 | 44 | 32.3 | 10.5 | 78.3 | 50.9 | |
| LLaVA-NeXT-VideoParameters=7B2026.02 | 49.8 | 40 | 28.2 | 1.8 | 64.7 | 55.6 | |
| LLaVA-NeXT-Video-7BCategory=Open-sourced VLMs, Parameters=7B2026.05 | 49.8 | 40 | 28.2 | 1.8 | 64.7 | 55.6 | |
| VLM-3RParameters=7B2026.02 | 60.6 | 58.8 | 39.4 | 39.6 | 86.5 | 68.6 | |
| VLM-3R-7BCategory=Specialized Spatial Reasoning Models, Parameters=7B2026.05 | 60.6 | 58.8 | 39.4 | 39.6 | 86.5 | 68.6 | |
| VLM2-7BCategory=Specialized Spatial Reasoning Models, Parameters=7B2026.05 | 76.8 | 65.3 | 43.1 | 44.1 | 87.7 | 74.9 | |
| GeoThinkerBackbone=Qwen3VL-8B2026.02 | 84.2 | 67.4 | 38.4 | 45.8 | 93.6 | 75.2 | |
| Q-GeoMemCategory=Specialized Spatial Reasoning Models2026.05 | 84.3 | 67 | 40 | 44.7 | 91.2 | 74.8 | |
| Human Level2026.02 | 95.1 | 77 | 51.4 | 46.8 | 97.5 | 94.3 |