Spatial Reasoning on OmniSpatial
79.4AccuracyQwen3-VL-8B-Instruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-VL-8B-InstructModel=Qwen3-VL-8B-Instruct2026.03 | 79.4 | — | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL-3B2026.03 | 77.5 | — | |
| SpaceQwen2.5-VL-3B-InstructModel=SpaceQwen2.5-VL-3B-Instruct2026.03 | 69.6 | — | |
| SpatialLadder-3BModel=SpatialLadder-3B2026.03 | 67.6 | — | |
| 3ViewSense-4B-rl-slackTraining=RL, Reward=Slack2026.03 | 67.6 | — | |
| 3ViewSense-4B-sftTraining=SFT2026.03 | 66.7 | — | |
| 3ViewSense-4B-rl-strictTraining=RL, Reward=Strict2026.03 | 65.7 | — | |
| Qwen3-VL-4B-InstructModel=Qwen3-VL-4B-Instruct2026.03 | 61.8 | — | |
| InternVL3.5-4BModel=InternVL3.5-4B2026.03 | 59.8 | — | |
| Vision-SR1Backbone=Qwen2.5-VL-7B2025.08 | 44.2 | — | |
| Vision-SR1Backbone=Mimo-VL-7B2025.08 | 42.7 | — | |
| Vision-R1Backbone=Mimo-VL-7B2025.08 | 40.4 | — | |
| before RLBackbone=Mimo-VL-7B2025.08 | 40.3 | — | |
| Vision-R1Backbone=Qwen2.5-VL-7B2025.08 | 31.1 | — | |
| before RLBackbone=Qwen2.5-VL-7B2025.08 | 27.3 | — | |
| SpaceOm-4BModel=SpaceOm-4B2026.03 | 23.5 | — | |
| CoT promptingBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=CoT prompting2026.04 | — | 40.4 | |
| CoT promptingBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=CoT prompting2026.04 | — | 40.77 | |
| FGRPOBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Faithful GRPO2026.04 | — | 44.78 | |
| FGRPOBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Faithful GRPO2026.04 | — | 43.6 | |
| GPT-4o (CoT)Reasoning Strategy=CoT2026.04 | — | 45.73 | |
| GPT-5-nano (CoT)Reasoning Strategy=CoT2026.04 | — | 41.03 | |
| GRPO-TBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 40.9 | |
| GRPO-TBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 39.88 | |
| Non-reasoningBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Non-reasoning2026.04 | — | 45.23 | |
| Non-reasoningBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Non-reasoning2026.04 | — | 45.92 | |
| R1-OneVisionReasoning Strategy=MRM baseline2026.04 | — | 31.54 | |
| TreeVGRReasoning Strategy=MRM baseline2026.04 | — | 45.99 | |
| ViGoRL-SpatialReasoning Strategy=MRM baseline2026.04 | — | 36.97 | |
| Vision-R1Reasoning Strategy=MRM baseline2026.04 | — | 39.75 | |
| VL-RethinkerReasoning Strategy=MRM baseline2026.04 | — | 39.84 |