Spatial Reasoning on Mind Cube (Pass@1)
49.28Accuracy (Pass@1)FGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| FGRPOBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Faithful GRPO2026.04 | 49.28 | |
| FGRPOBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Faithful GRPO2026.04 | 49.1 | |
| GRPO-TBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=RL (Task Reward Only)2026.04 | 46.06 | |
| Non-reasoningBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Non-reasoning2026.04 | 43.71 | |
| GPT-4o (CoT)Reasoning Strategy=CoT2026.04 | 43.52 | |
| TreeVGRReasoning Strategy=MRM baseline2026.04 | 43.14 | |
| GRPO-TBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=RL (Task Reward Only)2026.04 | 41.71 | |
| CoT promptingBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=CoT prompting2026.04 | 40.38 | |
| ViGoRL-SpatialReasoning Strategy=MRM baseline2026.04 | 39.36 | |
| VL-RethinkerReasoning Strategy=MRM baseline2026.04 | 37.81 | |
| Vision-R1Reasoning Strategy=MRM baseline2026.04 | 36.95 | |
| Non-reasoningBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Non-reasoning2026.04 | 35.11 | |
| CoT promptingBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=CoT prompting2026.04 | 30.83 | |
| GPT-5-nano (CoT)Reasoning Strategy=CoT2026.04 | 27.71 | |
| R1-OneVisionReasoning Strategy=MRM baseline2026.04 | 27.09 |