Visual Question Answering on 14 benchmarks 8 spatial and 6 real-world (test)
74.5Average Accuracy (14 Benchmarks)SpatialThinker-30B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SpatialThinker-30BTraining Dataset=STVQA-7K, Training Method=Spatial RL (Ours)2025.11 | 74.5 | 6.4 | 3 | 8.7 | 5.8 | |
| GPT-5-0807Category=Proprietary MLLM2025.11 | 71.5 | — | — | — | — | |
| SpatialThinker-7BTraining Dataset=STVQA-7K, Training Method=Spatial RL (Ours)2025.11 | 70.5 | 7.7 | -1 | 4.7 | 1.8 | |
| Claude-4-Sonnet-0514Category=Proprietary MLLM2025.11 | 68.7 | — | — | — | — | |
| Qwen3-VL-30BCategory=Base MLLM2025.11 | 68.1 | — | — | — | — | |
| Qwen2.5-VL-7B + Vanilla GRPOTraining Dataset=STVQA-7K, Training Method=Vanilla GRPO2025.11 | 67.2 | 4.4 | -4.3 | 1.4 | -1.5 | |
| SpatialThinker-3BTraining Dataset=STVQA-7K, Training Method=Spatial RL (Ours)2025.11 | 65.9 | 9.1 | -5.6 | 0.1 | -2.8 | |
| GPT-4o-0513Category=Proprietary MLLM2025.11 | 65.8 | — | — | — | — | |
| Qwen2.5-VL-7B + SFTTraining Dataset=STVQA-7K, Training Method=SFT2025.11 | 64.9 | 2.1 | -6.6 | -0.9 | -3.8 | |
| Qwen2.5-VL-7BCategory=Base MLLM2025.11 | 62.8 | — | — | — | — | |
| Qwen2.5-VL-3B + Vanilla GRPOTraining Dataset=STVQA-7K, Training Method=Vanilla GRPO2025.11 | 62 | 5.2 | -9.5 | -3.8 | -6.7 | |
| Claude-3.5-Sonnet-0620Category=Proprietary MLLM2025.11 | 60.9 | — | — | — | — | |
| Qwen2.5-VL-3B + SFTTraining Dataset=STVQA-7K, Training Method=SFT2025.11 | 60.7 | 3.9 | -10.8 | -5.1 | -8 | |
| Qwen2.5-VL-3BCategory=Base MLLM2025.11 | 56.8 | — | — | — | — |