Spatial Reasoning on CV-Bench-3D (Multi-choice)
96.3AccuracyN3D-VLM-3B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| N3D-VLM-3BCategory=Ours2025.12 | 96.3 | — | |
| N3D-VLM-7BCategory=Ours2025.12 | 93.3 | — | |
| Qwen3-VL-8BCategory=Open-source2025.12 | 91.3 | — | |
| Gemini-2.5-FlashCategory=Closed-source2025.12 | 86 | — | |
| NashStrategy=Step-wise verification2026.05 | 82.34 | — | |
| LLaVA CriticStrategy=Step-wise verification2026.05 | 81.58 | — | |
| SpatialReasoner-7BCategory=Open-source2025.12 | 80.3 | — | |
| Qwen2.5-VL-7BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 80.1 | — | |
| VG-LLMFT-Data=385k, Fine-tuned on identical training data=false2026.03 | 79.1 | — | |
| GeoSenseFT-Data=940K, Fine-tuned on identical training data=false2026.03 | 78.7 | — | |
| ViLASR-7BFT-Data=73K, Fine-tuned on identical training data=false2026.03 | 77.2 | — | |
| BaseStrategy=Step-wise verification2026.05 | 76.39 | — | |
| Qwen2.5-VL-7BCategory=Open-source2025.12 | 75.8 | — | |
| SpaceR-sft-7BFT-Data=151K, Fine-tuned on identical training data=false2026.03 | 75.7 | — | |
| Cambrain-S-3BFT-Data=10M, Fine-tuned on identical training data=false2026.03 | 75.2 | — | |
| SpatialLadder-3BCategory=Open-source2025.12 | 74.9 | — | |
| InternVL3-2BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 74.3 | — | |
| SpatialLadder-3BFT-Data=26K, Fine-tuned on identical training data=false2026.03 | 73.7 | — | |
| GPT-4oCategory=Closed-source2025.12 | 72.4 | — | |
| Qwen2.5-VL-3BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 71.8 | — | |
| VG-LLM*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 71.7 | — | |
| Qwen2.5-VL-3B*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 67.9 | — | |
| SpatialRGPT-VILA-1.5-8BCategory=Open-source2025.12 | 63.3 | — | |
| SiTebackbone=Qwen2-flickr, variant=rand2025.12 | 51.67 | — | |
| Qwen2variant=flickr2025.12 | 51.57 | — | |
| SiTebackbone=Qwen2-flickr, variant=ratio2025.12 | 51.5 | — | |
| SiTebackbone=Qwen2, variant=ratio2025.12 | 50.4 | — | |
| SiTebackbone=Qwen2, variant=rand2025.12 | 50.36 | — | |
| Qwen2variant=Baseline2025.12 | 47.63 | — | |
| SiTebackbone=LLaVA-flickr, variant=ratio2025.12 | 39.8 | — | |
| SiTebackbone=LLaVA-flickr, variant=rand2025.12 | 38.66 | — | |
| SiTebackbone=LLaVA, variant=ratio2025.12 | 36.53 | — | |
| SiTebackbone=LLaVA, variant=rand2025.12 | 35.5 | — | |
| VisionSR1Strategy=Step-wise verification2026.05 | 34.28 | — | |
| LLaVAvariant=Baseline2025.12 | 33.43 | — | |
| SherlockStrategy=Step-wise verification2026.05 | 28.67 | — | |
| LLaVAvariant=flickr2025.12 | 28.39 | — | |
| CoT promptingBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=CoT prompting2026.04 | — | 76.09 | |
| CoT promptingBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=CoT prompting2026.04 | — | 68 | |
| FGRPOBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Faithful GRPO2026.04 | — | 87.04 | |
| FGRPOBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Faithful GRPO2026.04 | — | 82.5 | |
| GPT-4o (CoT)Reasoning Strategy=CoT2026.04 | — | 86.42 | |
| GPT-5-nano (CoT)Reasoning Strategy=CoT2026.04 | — | 86.75 | |
| GRPO-TBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 85.92 | |
| GRPO-TBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 80.44 | |
| Non-reasoningBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Non-reasoning2026.04 | — | 83.78 | |
| Non-reasoningBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Non-reasoning2026.04 | — | 74 | |
| R1-OneVisionReasoning Strategy=MRM baseline2026.04 | — | 58 | |
| TreeVGRReasoning Strategy=MRM baseline2026.04 | — | 73.92 | |
| ViGoRL-SpatialReasoning Strategy=MRM baseline2026.04 | — | 86.14 | |
| Vision-R1Reasoning Strategy=MRM baseline2026.04 | — | 75.83 | |
| VL-RethinkerReasoning Strategy=MRM baseline2026.04 | — | 80.75 |