Spatial Reasoning on SpatialBench
69.5AccuracySpatialThinker-30B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SpatialThinker-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 69.5 | — | |
| Qwen3-VL-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 68.1 | — | |
| GPT-4o-0513Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 67 | — | |
| SpatialThinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 66.4 | — | |
| VLAA-Thinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 66.2 | — | |
| Qwen2.5-VL-7B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 64.2 | — | |
| Qwen2.5-VL-7B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 63.5 | — | |
| Claude-3.5-Sonnet-0620Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 63.2 | — | |
| GPT-5-0807Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 62.6 | — | |
| Qwen2.5-VL-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 62.5 | — | |
| SpatialThinker-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 61.5 | — | |
| Claude-4-Sonnet-0514Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 60.9 | — | |
| SATORI-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 60.3 | — | |
| Visionary-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 59.8 | — | |
| SpatialReasonerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 59.2 | — | |
| SpaceOmEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 58.6 | — | |
| SpaceThinkerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 57.9 | — | |
| Qwen2.5-VL-3B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 56.9 | — | |
| Qwen2.5-VL-3B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 56.3 | — | |
| Qwen2.5-VL-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 49.9 | — | |
| Qwen2.5-VLSize=7B2026.03 | — | 64.7 | |
| Qwen3-VLSize=8B2026.03 | — | 65.3 | |
| SOLE-R1Size=8B2026.03 | — | 69.4 | |
| SSRSize=7B2026.03 | — | 67 |