Spatial Reasoning on CVB 2D (Pass@1)
82.38Accuracy (Pass@1)FGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| FGRPOBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Faithful GRPO2026.04 | 82.38 | |
| GRPO-TBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=RL (Task Reward Only)2026.04 | 79.97 | |
| GPT-4o (CoT)Reasoning Strategy=CoT2026.04 | 78.23 | |
| FGRPOBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Faithful GRPO2026.04 | 77.95 | |
| GRPO-TBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=RL (Task Reward Only)2026.04 | 77.24 | |
| Non-reasoningBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Non-reasoning2026.04 | 77.17 | |
| ViGoRL-SpatialReasoning Strategy=MRM baseline2026.04 | 76.59 | |
| GPT-5-nano (CoT)Reasoning Strategy=CoT2026.04 | 76.29 | |
| VL-RethinkerReasoning Strategy=MRM baseline2026.04 | 76.06 | |
| CoT promptingBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=CoT prompting2026.04 | 75.92 | |
| TreeVGRReasoning Strategy=MRM baseline2026.04 | 74.69 | |
| Vision-R1Reasoning Strategy=MRM baseline2026.04 | 71.58 | |
| CoT promptingBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=CoT prompting2026.04 | 71.21 | |
| Non-reasoningBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Non-reasoning2026.04 | 70.58 | |
| R1-OneVisionReasoning Strategy=MRM baseline2026.04 | 53.31 |