Spatial Reasoning on All-Angles Bench
52.8Cam. Pose Est. AccuracyQwen2.5-VL-7B (+ GASP Full Model)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-VL-7B (+ GASP Full Model)Base Model=Qwen2.5-VL-7B, Loss Function=Lcorr + Ldepth2026.05 | 52.8 | 40.1 | 37.2 | |
| Qwen2.5-VL-7B (+ GASP Correspondence)Base Model=Qwen2.5-VL-7B, Loss Function=Lcorr2026.05 | 50 | 39.3 | 37.8 | |
| LLaVA-NeXT-Video-7B (+ GASP Full Model)Base Model=LLaVA-NeXT-Video-7B, Loss Function=Lcorr + Ldepth2026.05 | 40.9 | 43.5 | 29.8 | |
| InternVL2.5-78BModel Category=General VLMs2026.05 | 38.6 | 42.2 | 38.6 | |
| InternVL2.5-4BModel Category=General VLMs2026.05 | 36.9 | 40.1 | 33.2 | |
| LLaVA-NeXT-Video-7B (+ GASP Correspondence)Base Model=LLaVA-NeXT-Video-7B, Loss Function=Lcorr2026.05 | 34.7 | 44.3 | 26.4 | |
| Qwen2.5-VL-72BModel Category=General VLMs2026.05 | 34.1 | 45 | 48.3 | |
| Qwen2.5-VL-7B (Baseline)Base Model=Qwen2.5-VL-7B, Training Data=SFT on LLaVA-Video 178K2026.05 | 34.1 | 41.3 | 36.9 | |
| Qwen2.5-VL-32BModel Category=General VLMs2026.05 | 32.4 | 49.8 | 40.9 | |
| AoTDModel Category=3D Spatial Reasoning VLMs, Training Data=Finetuning on 3D Related VQAs2026.05 | 32.4 | 37.6 | 26.7 | |
| InternVL2.5-8BModel Category=General VLMs2026.05 | 31.8 | 43.7 | 34.1 | |
| Qwen2.5-VL-7B (+ DL3DV)Base Model=Qwen2.5-VL-7B, Training Data=SFT on DL3DV VQA dataset2026.05 | 31.5 | 41.5 | 36.2 | |
| GPT-4oModel Category=General VLMs2026.05 | 27.3 | 41.4 | 40.9 | |
| Gemini-1.5-ProModel Category=General VLMs2026.05 | 25 | 40.3 | 29.8 | |
| VLM-3RModel Category=3D Spatial Reasoning VLMs, Training Data=Finetuning on 3D Related VQAs2026.05 | 22.7 | 35.9 | 30.9 | |
| LLaVA-NeXT-Video-7B (Baseline)Base Model=LLaVA-NeXT-Video-7B, Training Data=SFT on LLaVA-Video 178K2026.05 | 22.7 | 39.9 | 24.7 | |
| LLaVA-Onevision-7BModel Category=General VLMs2026.05 | 20.5 | 42.4 | 36.4 | |
| LLaVA-Onevision-72BModel Category=General VLMs2026.05 | 20.5 | 47.7 | 33.8 | |
| LLaVA-NeXT-Video-7B (+ DL3DV)Base Model=LLaVA-NeXT-Video-7B, Training Data=SFT on DL3DV VQA dataset2026.05 | 19.8 | 38.1 | 28.2 | |
| VG-LLMModel Category=3D Spatial Reasoning VLMs, Training Data=Finetuning on 3D Related VQAs2026.05 | 16.5 | 30 | 26.9 | |
| Cambrain-8BModel Category=General VLMs2026.05 | 8.5 | 30.7 | 30.4 |