Multi-image Spatial Reasoning on MMSI-Bench
38Overall AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Gemini-2.5-ProData Scale=-, Training Phases=-2026.01 | 38 | — | — | — | — | |
| SmoothOp-7BData Scale=50K, Training Phases=1 (R)2026.01 | 33.7 | — | — | — | — | |
| SmoothOp-3BData Scale=50K, Training Phases=1 (R)2026.01 | 32.2 | — | — | — | — | |
| VST-7B-SFTData Scale=4.1M, Training Phases=1 (S)2026.01 | 32 | — | — | — | — | |
| LLava-OneVision-7BData Scale=-, Training Phases=-2026.01 | 31 | — | — | — | — | |
| GPT-4oData Scale=-, Training Phases=-2026.01 | 30.3 | — | — | — | — | |
| ViLaSR-7BData Scale=81K, Training Phases=2 (S+R)2026.01 | 30.2 | — | — | — | — | |
| VST-3B-SFTData Scale=4.1M, Training Phases=1 (S)2026.01 | 30.2 | — | — | — | — | |
| CAMCUEBackbone=Qwen2.5-VL-7B, Evaluation Mode=Pose-Only (without imagined image feedback)2026.02 | 28.8 | 29.9 | 29.2 | 27.3 | 26.8 | |
| Qwen2.5-VL-3BData Scale=-, Training Phases=-2026.01 | 28.6 | — | — | — | — | |
| InternVL3-8BData Scale=-, Training Phases=-2026.01 | 28 | — | — | — | — | |
| Qwen2.5-VL-7BData Scale=-, Training Phases=-2026.01 | 26.8 | — | — | — | — | |
| SpatialLadder-3BData Scale=26K, Training Phases=3 (S+R)2026.01 | 26.1 | — | — | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Evaluation Mode=Base (backbone-only)2026.02 | 25.9 | 25.9 | 21.5 | 30 | 25.8 | |
| SpaceR-7BData Scale=151K, Training Phases=2 (S+R)2026.01 | 20.1 | — | — | — | — |