Spatial Reasoning on WhatsUp-B
99.9Binary Robust AccuracyLoRA-DPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LoRA-DPOModel Family=Qwen family, Backbone=Qwen2-VL-7B2026.06 | 99.9 | 99.4 | 98 | 0.9 | 1.9 | 3.9 | |
| LoRA-DPOModel Family=Qwen family, Backbone=Qwen3-VL-2B2026.06 | 99.2 | 95.9 | 90.7 | 5.6 | 12.7 | 19.1 | |
| LoRA-DPOModel Family=Qwen family, Backbone=Qwen3-VL-8B2026.06 | 98.6 | 96.9 | 88.7 | 2.2 | 4.7 | 4.9 | |
| LoRA-DPOModel Family=LLaVA family, Backbone=LLaVA-v1.6-Mistral-7B2026.06 | 98 | 93.6 | 84.2 | 36.2 | 57 | 68 | |
| LoRA-DPOModel Family=Qwen family, Backbone=Qwen2-VL-2B2026.06 | 97.6 | 92.9 | 84.5 | 19.5 | 29 | 36.7 | |
| LoRA-DPOModel Family=LLaVA family, Backbone=LLaVA-v1.6-Vicuna-7B2026.06 | 95 | 82.1 | 59.6 | 20 | 44.7 | 33.3 | |
| LoRA-DPOModel Family=InternVL family, Backbone=InternVL2.5-1B2026.06 | 88.8 | 77 | 73.4 | 17.8 | 29.8 | 34.2 | |
| LoRA-DPOModel Family=InternVL family, Backbone=InternVL2-1B2026.06 | 87.4 | 67.5 | 32.8 | 20.6 | 30.2 | 15.6 | |
| LoRA-DPOModel Family=LLaVA family, Backbone=LLaVA-1.5-7B2026.06 | 78.5 | 67.2 | 56 | 38.9 | 50.6 | 49.6 |