Spatial Reasoning on MMSI
32.3ScoreQwen2.5-VL-7B + SAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + SAGEModel=Qwen2.5-VL-7B + SAGE2026.05 | 32.3 | |
| Qwen3-VL-8BModel Parameters=8B2026.06 | 31.1 | |
| GPT-4oModel=GPT-4o2026.05 | 30.3 | |
| ViLASR-7BFT-Data=73K, Fine-tuned on identical training data=false2026.03 | 30.2 | |
| Ouro-Spatial-4BModel Parameters=4B2026.06 | 29.7 | |
| Ouro-Spatial-8BModel Parameters=8B2026.06 | 29.3 | |
| SpatialLadder-3BModel=SpatialLadder-3B2026.05 | 29.2 | |
| Qwen2.5-VL-3BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 28.6 | |
| Qwen3-VL-4BModel Parameters=4B2026.06 | 28.3 | |
| VG-LLMFT-Data=385k, Fine-tuned on identical training data=false2026.03 | 27.6 | |
| GeoSenseFT-Data=940K, Fine-tuned on identical training data=false2026.03 | 27.5 | |
| SpaceR-sft-7BFT-Data=151K, Fine-tuned on identical training data=false2026.03 | 27.4 | |
| SpatialLadder-3BFT-Data=26K, Fine-tuned on identical training data=false2026.03 | 27.4 | |
| Cambrain-S-3BFT-Data=10M, Fine-tuned on identical training data=false2026.03 | 27 | |
| Qwen2.5-VL-7BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 26.8 | |
| InternVL3-2BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 26.5 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B2026.05 | 26.4 | |
| InternVL-2.5-8BModel=InternVL-2.5-8B2026.05 | 25.7 | |
| VG-LLM*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 25.2 | |
| LLaVA-OV-7BModel=LLaVA-OV-7B2026.05 | 24.5 | |
| Qwen2.5-VL-3B*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 24.2 |