Spatial Understanding on MMVP
77AccuracyQwen2.5-VL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-VL2026.01 | 77 | — | |
| LLaVA-OneVision2026.01 | 76.7 | — | |
| Molmo2026.01 | 75.3 | — | |
| Gemma3-4b-it2026.01 | 70.8 | — | |
| SmolVLM22026.01 | 68.7 | — | |
| LLaVA-NeXT2026.01 | 66.7 | — | |
| PaliGemma2026.01 | 66.7 | — | |
| LLaVA v1.52026.01 | 57.7 | — | |
| LLaVA-AIMv2-2D-RoPEencoder=AIMv2, positional_embedding=2D-RoPE2026.01 | 56 | — | |
| LLaVA-2D-RoPEpositional_embedding=2D-RoPE2026.01 | 51.3 | — | |
| LLaVA-AIMv2encoder=AIMv22026.01 | 51.3 | — | |
| LLaVA-SigLIP-2D-RoPEencoder=SigLIP, positional_embedding=2D-RoPE2026.01 | 50.7 | — | |
| LLaVA-SigLIP2-2D-RoPEencoder=SigLIP2, positional_embedding=2D-RoPE2026.01 | 48 | — | |
| LLaVA-SigLIPencoder=SigLIP2026.01 | 43.3 | — | |
| LLaVA-SigLIP2encoder=SigLIP22026.01 | 42.7 | — | |
| CoT promptingBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=CoT prompting2026.04 | — | 72.44 | |
| CoT promptingBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=CoT prompting2026.04 | — | 63.67 | |
| FGRPOBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Faithful GRPO2026.04 | — | 73.33 | |
| FGRPOBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Faithful GRPO2026.04 | — | 64.3 | |
| GPT-4o (CoT)Reasoning Strategy=CoT2026.04 | — | 84.33 | |
| GPT-5-nano (CoT)Reasoning Strategy=CoT2026.04 | — | 75.67 | |
| GRPO-TBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 74 | |
| GRPO-TBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=RL (Task Reward Only)2026.04 | — | 65.22 | |
| Non-reasoningBackbone=Qwen2.5-VL-7B-Instruct, Model Scale=7B, Reasoning Strategy=Non-reasoning2026.04 | — | 75.78 | |
| Non-reasoningBackbone=Qwen2.5-VL-3B-Instruct, Model Scale=3B, Reasoning Strategy=Non-reasoning2026.04 | — | 64.67 | |
| R1-OneVisionReasoning Strategy=MRM baseline2026.04 | — | 56.16 | |
| TreeVGRReasoning Strategy=MRM baseline2026.04 | — | 71 | |
| ViGoRL-SpatialReasoning Strategy=MRM baseline2026.04 | — | 73.22 | |
| Vision-R1Reasoning Strategy=MRM baseline2026.04 | — | 72.22 | |
| VL-RethinkerReasoning Strategy=MRM baseline2026.04 | — | 75.89 |