3D Question Answering on SQA3D (test)
64.8EM@1PolyV
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PolyV2026.03 | 64.8 | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | |
| Ross3DPoint Encoder=No, Vision Encoder=Yes2026.02 | 63 | 65.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ROSS3D2026.03 | 63 | — | — | — | — | — | — | — | 65.7 | — | — | — | — | — | — | |
| Ross3DModel Category=3D MLLMs2026.03 | 63 | 65.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ross3DSupervision=Fully Supervised2026.06 | 63 | — | 56 | 79.8 | 60.6 | 70.4 | 55.3 | 60.1 | 65.7 | — | — | — | — | — | — | |
| Loc3R-VLMModel Category=2D MLLMs2026.03 | 62.8 | 65 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CVP2025.12 | 62.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLM-3RVideo Input Only=true2025.05 | 60.7 | — | — | — | — | — | — | — | 63.4 | — | — | — | — | — | — | |
| 3DRSModel Category=3D MLLMs2026.03 | 60.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3DRSSupervision=Fully Supervised2026.06 | 60.6 | — | 54.4 | 75.2 | 57 | 72.2 | 49.9 | 59 | — | — | — | — | — | — | — | |
| LLaVA-3DVenue=ICCV’25, Input=RGBD2026.06 | 60.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Lemon2025.12 | 59.4 | 63 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT4SceneModel Category=2D MLLMs2026.03 | 59.4 | 62.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniMVUSize=7B, Training Protocol=task-specific training2026.05 | 59.4 | — | 53.4 | 75.9 | 55.9 | — | — | — | — | — | 61.6 | 57.7 | 76.8 | 56.1 | — | |
| Video-3D LLMVenue=CVPR 20252025.12 | 58.6 | — | 51.1 | 72.4 | 55.5 | 69.8 | 51.3 | 56 | — | — | — | — | — | — | — | |
| Video-3D-LLM2025.12 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D-LLMPoint Encoder=No, Vision Encoder=Yes2026.02 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D-LLM2026.03 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D-LLMModel Category=3D MLLMs2026.03 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D LLMVideo Input Only=false2025.05 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D LLMModel input type=3D/2.5D-Input Models2025.05 | 58.6 | — | 51.1 | 72.4 | 55.5 | 69.8 | 51.3 | 56 | — | — | — | — | — | — | — | |
| Video-3D LLMModel Category=3D/2.5D-Input Models, Video-Input Only=false2025.05 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=322026.06 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D LLMSupervision=Fully Supervised2026.06 | 58.6 | — | 51.1 | 72.4 | 55.5 | 69.8 | 51.3 | 56 | — | — | — | — | — | — | — | |
| Struct2DModel Category=2D MLLMs2026.03 | 58.5 | 61.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D-LLMVenue=CVPR’25, Input=RGBD2026.06 | 58.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Occ-VLMInput=RGB2026.06 | 58.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3D LLMEvaluation Protocol=Fine-tuned, Online Sampling=true, Sampling Strategy=Uniform2026.07 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPARModel Category=2D MLLMs2026.03 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniMVU†Size=7B, Training Protocol=unified multi-task training2026.05 | 58.1 | — | 52.3 | 70.7 | 60.4 | — | — | — | — | — | 60.4 | 56.6 | 71.8 | 61.1 | — | |
| KeyVTBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=162026.06 | 57.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PAVE*Size=7B2026.05 | 57.6 | — | 52.3 | 69.2 | 56.3 | — | — | — | — | — | 59.9 | 56.9 | 69.9 | 57.4 | — | |
| AKSBackbone=LLaVAVideo-7B, input frames=82026.06 | 57.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Uni3D-MoE2026.03 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FLoCBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 57.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoPE-VideoLM-7BPoint Encoder=No, Vision Encoder=Yes, Evaluation Protocol=Fine-tuned, Token Budget=25.48%2026.02 | 57.1 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KeyVTBackbone=LLaVA-OV-7B, input frames=8eq2026.06 | 57.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=82026.06 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CdViewsModel Category=2D MLLMs2026.03 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| cdViewsBackbone=LLaVA-OV-7B, input frames=92026.06 | 56.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Efficient-VLNVenue=–2025.12 | 56.2 | — | 46.9 | 71.8 | 54.4 | 72.5 | 45.6 | 55.1 | — | — | — | — | — | — | — | |
| AKSBackbone=LLaVA-OV-7B, input frames=82026.06 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoE3DModality=PC, Model Category=3D LMM2025.11 | 56 | 58.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Spatial-MLLM2026.03 | 55.9 | — | — | — | — | — | — | — | 58.7 | — | — | — | — | — | — | |
| SpatialMLLM-4BModel Category=2D MLLMs2026.03 | 55.9 | 58.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Spatial-MLLM-4BVideo Input Only=true2025.05 | 55.9 | — | — | — | — | — | — | — | 58.7 | — | — | — | — | — | — | |
| Spatial-MLLM-4BModel input type=Video-Input Models2025.05 | 55.9 | — | 45.9 | 71.6 | 55.1 | 69.5 | 52 | 53 | 58.7 | — | — | — | — | — | — | |
| Spatial-MLLM-4BModel Category=Video-Input Models, Video-Input Only=true2025.05 | 55.9 | — | — | — | — | — | — | — | 58.7 | — | — | — | — | — | — | |
| 3DGraphLLMcategory=Generalist 3D-MLLMs2026.06 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Spatial-MLLMVenue=NIPS’25, Input=RGB2026.06 | 55.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-FT (video-only)Size=7B2026.05 | 55.8 | — | — | — | — | — | — | — | — | — | 58.1 | — | — | — | — | |
| DivPruneBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 55.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3DVenue=ICCV 20252025.12 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3D2025.12 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3DPoint Encoder=No, Vision Encoder=Yes2026.02 | 55.6 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3D2026.03 | 55.6 | — | — | — | — | — | — | — | 57.6 | — | — | — | — | — | — | |
| LLaVA-3DModel Category=3D MLLMs2026.03 | 55.6 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-3D-7BSize=7B2026.05 | 55.6 | — | — | — | — | — | — | — | — | — | 57.6 | — | — | — | — | |
| UniMVUSize=0.5B, Training Protocol=task-specific training2026.05 | 55.2 | — | 46.5 | 67.6 | 57.4 | — | — | — | — | — | 57.1 | 50.6 | 68.4 | 57.6 | — | |
| FLoCBackbone=LLaVA-OV-7B, input frames=8eq2026.06 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Agentic Collaborative CognitionSupervision=Zero-shot2026.06 | 54.8 | — | 50.2 | 65 | 46.7 | 67.8 | 46.4 | 55.7 | 57.1 | — | — | — | — | — | — | |
| Chat-3D v22025.12 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVAVideo-7Binput frames=82026.06 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-SceneModality=PC+I, Model Category=3D LMM2025.11 | 54.6 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-Scene2025.12 | 54.6 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChatSceneVenue=NeurIPS 20242025.12 | 54.6 | — | 45.4 | 67 | 52 | 69.5 | 49.9 | 55 | — | — | — | — | — | — | — | |
| Chat-Scene2025.12 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChatScenePoint Encoder=Yes, Vision Encoder=Yes2026.02 | 54.6 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChatSceneModel Category=3D MLLMs2026.03 | 54.6 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-SceneVideo Input Only=false2025.05 | 54.6 | — | — | — | — | — | — | — | 57.5 | — | — | — | — | — | — | |
| Chat-SceneModel input type=3D/2.5D-Input Models2025.05 | 54.6 | — | 45.4 | 67 | 52 | 69.5 | 49.9 | 55 | 57.5 | — | — | — | — | — | — | |
| Chat-SceneModel Category=3D/2.5D-Input Models, Video-Input Only=false2025.05 | 54.6 | — | — | — | — | — | — | — | 57.5 | — | — | — | — | — | — | |
| Chat-Sceneinput frames=–2026.06 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-Scenecategory=Generalist 3D-MLLMs2026.06 | 54.6 | — | — | — | — | — | — | — | 57.5 | — | — | — | — | — | — | |
| PAR3Dcategory=Generalist 3D-MLLMs2026.06 | 54.6 | — | — | — | — | — | — | — | 57.3 | — | — | — | — | — | — | |
| Chat-SceneVenue=NIPS’24, Input=PC2026.06 | 54.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chat-SceneSupervision=Fully Supervised2026.06 | 54.6 | — | 45.4 | 67 | 52 | 69.5 | 49.9 | 55 | — | — | — | — | — | — | — | |
| 3D-LLaVAModality=PC, Model Category=3D LMM2025.11 | 54.5 | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVAModel Category=3D MLLMs2026.03 | 54.5 | 56.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVALLMs=Vicuna-1.5-7B [9], #Params=58.26M, FLOP=37.752026.02 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVAVideo Input Only=false2025.05 | 54.5 | — | — | — | — | — | — | — | 56.6 | — | — | — | — | — | — | |
| 3D-LLaVAModel Category=3D/2.5D-Input Models, Video-Input Only=false2025.05 | 54.5 | — | — | — | — | — | — | — | 56.6 | — | — | — | — | — | — | |
| 3D-LLaVAinput frames=–2026.06 | 54.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVAcategory=Generalist 3D-MLLMs2026.06 | 54.5 | — | — | — | — | — | — | — | 56.6 | — | — | — | — | — | — | |
| Fase3DLLMs=Vicuna-1.5-7B [9], #Params=12.11M, FLOP=2.092026.02 | 54.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMModality=PC+I, Model Category=Finetuned 3D LMM2025.11 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LSceneLLM2025.12 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLM2025.12 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMModel input type=3D/2.5D-Input Models2025.05 | 54.2 | — | 40.9 | 69.1 | 45 | 70.8 | 47.2 | 52.3 | — | — | — | — | — | — | — | |
| Scene-LLM-7BSize=7B2026.05 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMcategory=Finetuned 3D-MLLMs2026.06 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMVenue=WACV’25, Input=PC+RGB2026.06 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMSupervision=Fully Supervised2026.06 | 54.2 | — | 40.9 | 69.1 | 45 | 70.8 | 47.2 | 52.3 | — | — | — | — | — | — | — | |
| View2CapModel Category=3D MLLMs2026.03 | 54 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fase3DLLMs=Qwen2.5-3B [52], #Params=10.54M, FLOP=2.042026.02 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7Binput frames=82026.06 | 53.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=LLaVA-OV-7B, input frames=8eq2026.06 | 53.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMModality=PC+I, Model Category=3D LMM2025.11 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Scene-LLMPoint Encoder=Yes, Vision Encoder=Yes2026.02 | 53.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — |