Spatial Reasoning on SpatialReasonerEval
92.6AccuracySpatialThinker-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| SpatialThinker-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 92.6 | |
| GPT-5-0807Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 90.5 | |
| Qwen3-VL-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 88.2 | |
| GPT-4o-0513Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 85.8 | |
| Claude-4-Sonnet-0514Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 85.7 | |
| Claude-3.5-Sonnet-0620Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 84.1 | |
| SpatialThinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 82.7 | |
| Qwen2.5-VL-7B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 79.6 | |
| SpatialThinker-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 76.5 | |
| SpatialReasonerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 76.4 | |
| Visionary-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 72.9 | |
| Qwen2.5-VL-7B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 70.8 | |
| Qwen2.5-VL-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 70.6 | |
| SATORI-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 70.5 | |
| SpaceThinkerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 69.6 | |
| Qwen2.5-VL-3B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 69.3 | |
| SpaceOmEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 68.9 | |
| Qwen2.5-VL-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 68 | |
| Qwen2.5-VL-3B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 67.5 | |
| VLAA-Thinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 61.2 |