Spatial Perception on CV-Bench Average
85.5AccuracySpatialStack-5B
Evaluation Results
| Method | Links | |
|---|---|---|
| SpatialStack-5BModel Type=Dual-Encoder MLLMs, Backbone=Qwen3.52026.03 | 85.5 | |
| Qwen3.5-4BModel Type=Open-source Models2026.03 | 85 | |
| SpatialStack-4BModel Type=Dual-Encoder MLLMs, Backbone=Qwen2.52026.03 | 81.2 | |
| SPAR-8BModel Type=Open-source Models2026.03 | 80.7 | |
| VG-LLM-4BModel Type=Dual-Encoder MLLMs2026.03 | 79.5 | |
| GPT-4oModel Type=Proprietary Models (API)2026.03 | 78.9 | |
| SAT-LLaVA-Video-7BModel Type=Open-source Models2026.03 | 78.4 | |
| Cambrian-1-34BModel Type=Open-source Models2026.03 | 76.9 | |
| Cambrian-S-3BModel Type=Open-source Models2026.03 | 76.2 | |
| Mini-Gemini-HD-34BModel Type=Open-source Models2026.03 | 75.4 | |
| LLaVA-NeXT-34BModel Type=Open-source Models2026.03 | 73.9 | |
| Qwen2.5-VL-3BModel Type=Open-source Models2026.03 | 69.2 |