Spatial Understanding on CV-Bench 2D Overall
75.4AccuracyQwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL2026.01 | 75.4 | |
| LLaVA-OneVision2026.01 | 73 | |
| Molmo2026.01 | 72.8 | |
| Gemma3-4b-it2026.01 | 65.9 | |
| PaliGemma2026.01 | 62.4 | |
| LLaVA-NeXT2026.01 | 60.6 | |
| SmolVLM22026.01 | 57.7 | |
| LLaVA v1.52026.01 | 49 | |
| LLaVA-AIMv2encoder=AIMv22026.01 | 46.6 | |
| LLaVA-2D-RoPEpositional_embedding=2D-RoPE2026.01 | 44.3 | |
| LLaVA-SigLIP2encoder=SigLIP22026.01 | 44.2 | |
| LLaVA-AIMv2-2D-RoPEencoder=AIMv2, positional_embedding=2D-RoPE2026.01 | 43.2 | |
| LLaVA-SigLIP-2D-RoPEencoder=SigLIP, positional_embedding=2D-RoPE2026.01 | 42.5 | |
| LLaVA-SigLIP2-2D-RoPEencoder=SigLIP2, positional_embedding=2D-RoPE2026.01 | 41.5 | |
| LLaVA-SigLIPencoder=SigLIP2026.01 | 41.2 |