Spatial Reasoning on MMVP
85.33AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oSize=–2026.07 | 85.33 | |
| GPT-5.2Size=–2026.07 | 82.33 | |
| Qwen2.5-VLSize=72B2026.07 | 81.67 | |
| BRAIDSize=7B2026.07 | 81.33 | |
| SpatialThinker-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 79.7 | |
| SFTSize=7B2026.07 | 78.67 | |
| SpatialThinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 78 | |
| Qwen3-VL-30BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 77.9 | |
| Qwen2.5-VLSize=7B2026.07 | 77 | |
| BAGELSize=7B2026.07 | 75.67 | |
| VLAA-Thinker-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 75.3 | |
| Qwen2.5-VL-7B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 74.3 | |
| Qwen2.5-VL-7BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 72.3 | |
| Claude-4-Sonnet-0514Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 71.3 | |
| Claude-3.5-Sonnet-0620Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 71.3 | |
| GPT-4o-0513Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 70.7 | |
| Visionary-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 70.3 | |
| SpatialThinker-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 69 | |
| Qwen2.5-VL-3B + Vanilla GRPOEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 68.3 | |
| Qwen2.5-VL-7B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 68.3 | |
| SATORI-R1Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 67.7 | |
| Qwen2.5-VL-3BEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 67 | |
| SpaceOmEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 66.3 | |
| SpatialReasonerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 64 | |
| Janus-ProSize=7B2026.07 | 63.33 | |
| SpaceThinkerEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 63 | |
| Qwen2.5-VL-3B + SFTEvaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB, Training Dataset=STVQA-7K2025.11 | 62.7 | |
| GPT-5-0807Evaluation Setting=Zero-shot, Decoding=Greedy, Input Modality=RGB2025.11 | 61.7 | |
| ChameleonSize=7B2026.07 | 41.67 |