3D Visual Question Answering on ScanQA
15.9B-4 ScoreGPT4Scene-HD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT4Scene-HDLLM=Qwen2-VL-7B2026.07 | 15.9 | 89.9 | |
| Inst3D-LMMLLM=Vicuna-7B-v1.52026.07 | 14.9 | 88.6 | |
| Chat-SceneModel Category=LLM-based Models2023.12 | 14.3 | 87.7 | |
| Chat-Scene-7BSize=7B2026.04 | 14.3 | — | |
| Chat-SceneLLM=Vicuna-7B-v1.52026.07 | 14.3 | 87.7 | |
| Inst3D-LMMLLM=Qwen3-8B2026.07 | 13.6 | 91.5 | |
| LL3DAModel Category=LLM-based Models2023.12 | 13.5 | 76.8 | |
| LL3DALLM=OPT-1.3B2026.07 | 13.5 | 76.8 | |
| CAIRNLLM=Qwen3-8B2026.07 | 13.5 | 92.1 | |
| Grounded 3D-LLMLLM=Tiny-Vicuna-1B2026.07 | 13.4 | 72.7 | |
| CAPrunerBackbone=Llama-3-8B2026.04 | 13.2 | — | |
| LEOLLM=Vicuna-7B-v1.12026.07 | 13.2 | 101.4 | |
| 3D-VisTAModel Category=Expert Models2023.12 | 13.1 | 72.9 | |
| 3D-VisTA2026.04 | 13.1 | — | |
| 3D-VisTALLM=None2026.07 | 13.1 | 72.9 | |
| Chat-SceneLLM=Qwen3-8B2026.07 | 13.1 | 90.3 | |
| 3DGraphLLMLLM=Qwen3-8B2026.07 | 13.1 | 91.2 | |
| CAPrunerBackbone=Llama-3.2-1B2026.04 | 13 | — | |
| 3DGraphLLMSize=8B2026.04 | 12.5 | — | |
| 3DGraphLLMSize=1B2026.04 | 12.2 | — | |
| 3D-LLMModel Category=LLM-based Models2023.12 | 12 | 69.4 | |
| Scene-LLMModel Category=LLM-based Models2023.12 | 12 | 80 | |
| Scene-LLM2026.04 | 12 | — | |
| Scene-LLMLLM=Llama-2-7B2026.07 | 12 | 80 | |
| LEOModel Category=LLM-based Models2023.12 | 11.5 | 80 | |
| 3D-VLPModel Category=Expert Models2023.12 | 11.1 | 67 | |
| 3D-VLPLLM=None2026.07 | 11.1 | 67 | |
| ScanQAModel Category=Expert Models2023.12 | 10.1 | 64.9 | |
| 3D-LLMLLM=Flamingo2026.07 | 7.2 | 59.2 | |
| Chat-3DModel Category=LLM-based Models2023.12 | 6.4 | 53.2 | |
| LAMMModel Category=LLM-based Models2023.12 | 5.8 | 42.4 | |
| PQ3DLLM=None2026.07 | — | 87.8 |