3D Question Answering on ScanQA (val)
107.1CIDErCVP
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CVP2025.12 | 107.1 | — | 17.8 | 20.8 | 50.9 | 31.2 | — | — | — | — | — | — | — | — | |
| CVPMethod Type=3D LMMs2026.05 | 107.1 | — | 17.8 | 20.8 | 50.9 | 31.2 | — | — | — | — | — | — | — | — | |
| CVPModel category=3D LMMs2026.05 | 107.1 | — | 17.8 | 20.8 | 50.9 | 31.2 | — | — | — | — | — | — | — | — | |
| Ross3DPoint Encoder=No, Vision Encoder=Yes2026.02 | 107 | — | 17.9 | 20.9 | 50.7 | 30.8 | — | — | — | — | — | — | — | — | |
| ROSS3D2026.03 | 107 | — | 17.9 | 20.9 | — | — | — | — | 50.7 | — | — | — | — | — | |
| Ross3DModel Category=3D MLLMs2026.03 | 107 | — | — | 20.9 | 50.7 | 30.8 | — | — | — | — | — | — | — | — | |
| Ross3DSupervision=Fully Supervised2026.06 | 107 | 49.2 | 17.9 | 20.9 | 50.7 | 30.8 | 33.7 | 24.9 | — | — | — | — | — | — | |
| Ross3DSupervision=Fully Supervised2026.06 | 107 | — | 17.9 | 20.9 | 50.7 | 30.8 | — | — | — | — | — | — | — | — | |
| PolyV2026.03 | 105.6 | 50.2 | 18.6 | 23.1 | — | — | — | — | 51.9 | — | — | — | — | — | |
| 3DRS2026.03 | 104.8 | 48.4 | 17.2 | 20.5 | — | — | — | — | 49.8 | — | — | — | — | — | |
| 3DRSModel Category=3D MLLMs2026.03 | 104.8 | — | — | 20.5 | 49.8 | 30.3 | — | — | — | — | — | — | — | — | |
| 3DRSVision modal.=I, # of tokens=80002026.05 | 104.8 | — | — | — | — | 30.3 | — | — | — | — | — | — | — | — | |
| 3DRSSupervision=Fully Supervised2026.06 | 104.8 | 48.4 | 17.2 | 20.5 | 49.8 | 30.3 | 32.7 | 23.8 | — | — | — | — | — | — | |
| 3DRSSupervision=Fully Supervised2026.06 | 104.8 | — | 17.2 | 20.5 | 49.8 | 30.3 | — | — | — | — | — | — | — | — | |
| UniMVU†Size=7B, Training Protocol=unified multi-task training2026.05 | 104.2 | — | 17.8 | 20.1 | — | — | — | — | 49 | — | — | 29.2 | 48.8 | — | |
| LLaVA-3DInput 2D=true, Input 3D=true2026.03 | 103.1 | — | 16.4 | 20.8 | — | 30.6 | — | — | 49.6 | — | — | — | — | — | |
| LLaVA-3DVenue=ICCV’25, Input=RGBD2026.06 | 103.1 | — | 16.4 | 20.8 | 49.6 | — | — | — | — | — | — | 30.6 | — | — | |
| UniMVUSize=7B, Training Protocol=task-specific training2026.05 | 102.7 | — | 16 | 19.8 | — | — | — | — | 49 | — | — | 29.6 | 48.8 | — | |
| PAVE*Size=7B2026.05 | 102.4 | — | 16 | 19.8 | — | — | — | — | 48.8 | — | — | 28.9 | 48.2 | — | |
| Video-3D-LLM2025.12 | 102.1 | — | 16.2 | 19.8 | 49 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D-LLMPoint Encoder=No, Vision Encoder=Yes2026.02 | 102.1 | — | 16.4 | 20 | 49.3 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D-LLM2026.03 | 102.1 | — | 16.4 | 20 | — | — | — | — | 49.3 | — | — | — | — | — | |
| Video-3D LLMInput 2D=true, Input 3D=true2026.03 | 102.1 | 47.1 | 16.2 | 19.8 | — | 30.1 | 31.7 | 22.8 | 49 | — | — | — | — | — | |
| Video-3D-LLMModel Category=3D MLLMs2026.03 | 102.1 | — | — | 20 | 49.3 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D LLMVideo Input Only=false2025.05 | 102.1 | 47.1 | 16.2 | 19.8 | — | — | — | — | 49 | — | — | — | — | — | |
| 3D-IDE2026.03 | 102.1 | 47.5 | 17.4 | 20.8 | — | 29.8 | 32.9 | 23.7 | 48.8 | — | — | — | — | — | |
| Video-3D-LLMVision modal.=I, # of tokens=80002026.05 | 102.1 | — | — | — | — | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D-LLMMethod Type=3D LMMs2026.05 | 102.1 | — | 16.2 | 19.8 | 49 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D-LLMModel category=3D LMMs2026.05 | 102.1 | — | 16.2 | 19.8 | 49 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D LLMModel Category=3D/2.5D-Input Models, Video-Input Only=false2025.05 | 102.1 | 47.1 | 16.2 | 19.8 | — | — | — | — | 49 | — | — | — | — | — | |
| Video-3D LLMInput Modality=3D/2.5D-Input Models2025.05 | 102.1 | 47.1 | 16.2 | 19.8 | — | 30.1 | 31.7 | 22.8 | 49 | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=322026.06 | 102.1 | 47.1 | 16.2 | 19.8 | — | — | — | — | 49 | — | — | — | — | — | |
| Video-3D-LLMVenue=CVPR’25, Input=RGBD2026.06 | 102.1 | — | 15.8 | 19.8 | 49 | — | — | — | — | — | — | 30.1 | — | — | |
| Video-3D LLMSupervision=Fully Supervised2026.06 | 102.1 | 47.1 | 16.1 | 19.8 | 49 | 30.1 | 31.7 | 22.8 | — | — | — | — | — | — | |
| Video-3D LLMSupervision=Fully Supervised2026.06 | 102.1 | — | 16.3 | 19.8 | 49 | 30.1 | — | — | — | — | — | — | — | — | |
| Video-3D LLMInput Modality=3D/2.5D-Input Models2026.07 | 102.1 | 47.1 | 16.2 | 19.8 | — | — | 31.7 | 22.8 | 49 | — | — | 30.1 | — | — | |
| Video 3D-LLM2026.03 | 102 | 47.05 | 16.17 | 19.84 | — | 30.1 | 31.7 | 22.83 | 49.02 | — | — | — | — | — | |
| VLM-3RVideo Input Only=true2025.05 | 101.9 | 46.2 | 15.5 | 19.7 | — | — | — | — | 49.1 | — | — | — | — | — | |
| SpaR3D-MoEInput Modality=Video-Input Models2026.07 | 101.5 | 46.4 | 17.1 | 19.5 | — | — | 31.6 | 23.3 | 48.6 | — | — | 30.4 | — | — | |
| LEOModality=PC+I, Model Type=3D LMM2025.01 | 101.4 | — | 13.2 | 20 | — | — | — | — | 49.2 | — | — | — | — | — | |
| LEOModality=PC+I, Model Category=3D LMM, Setting=Ground-truth object information2025.11 | 101.4 | — | 13.2 | 20 | — | — | — | — | 49.2 | — | — | — | — | — | |
| LEO2025.12 | 101.4 | — | 13.2 | 20 | 49.2 | 24.5 | — | — | — | — | — | — | — | — | |
| LEOMethod Type=3D LMMs2026.05 | 101.4 | — | 13.2 | 20 | 49.2 | 24.5 | — | — | — | — | — | — | — | — | |
| LEOModel category=3D LMMs2026.05 | 101.4 | — | 13.2 | 20 | 49.2 | 24.5 | — | — | — | — | — | — | — | — | |
| LEOcategory=Generalist 3D-MLLMs2026.06 | 101.4 | — | 13.2 | 20 | — | — | — | — | 49.2 | — | — | — | — | — | |
| LEOSupervision=Fully Supervised2026.06 | 101.4 | — | 13.2 | 20 | 49.2 | 24.5 | — | — | — | — | — | — | — | — | |
| LEOSupervision=Fully Supervised2026.06 | 101.4 | — | 13.2 | 20 | 49.2 | 24.5 | — | — | — | — | — | — | — | — | |
| 3DRS*2026.03 | 101.3 | 47.9 | 16.9 | 20.2 | — | 29.7 | 32.5 | 23.8 | 48.3 | — | — | — | — | — | |
| KeyVTBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 100.7 | 46.6 | 14.5 | 19.4 | — | — | — | — | 48.8 | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=162026.06 | 100.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| baseline2026.03 | 100.5 | 46.9 | 16.2 | 19.6 | — | 29.5 | 31.3 | 22.7 | 48.8 | — | — | — | — | — | |
| Motion-MLLM-4BInput 2D=true, Input M=true2026.03 | 100.4 | 46.5 | 15.8 | 20.3 | — | 29.8 | 31.2 | 22.2 | 48 | — | — | — | — | — | |
| Loc3R-VLMModel Category=2D MLLMs2026.03 | 100.4 | — | — | 19.5 | 47.9 | 28.2 | — | — | — | — | — | — | — | — | |
| LEO-VLVision modal.=D,I, # of tokens=7502026.05 | 100.4 | — | — | — | — | 22.6 | — | — | — | — | — | — | — | — | |
| Video-3D LLMSampling Strategy=MC, Strategy=Fine-tuned2026.07 | 100.3 | — | — | — | — | 29.8 | — | — | — | — | — | — | — | — | |
| Occ-VLMInput=RGB2026.06 | 100 | — | 15.7 | 19.5 | 48.2 | — | — | — | — | — | — | 29.6 | — | — | |
| Video-3D LLMEvaluation Protocol=Fine-tuned, Online Sampling=true, Sampling Strategy=Uniform2026.07 | 99.6 | — | — | — | — | 29.6 | — | — | — | — | — | — | — | — | |
| FLoCBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 99.4 | 46.4 | 10.9 | 19.3 | — | — | — | — | 48.5 | — | — | — | — | — | |
| DivPruneBackbone=LLaVAVideo-7B, input frames=8eq2026.06 | 99.1 | 46.2 | 12.3 | 19.3 | — | — | — | — | 48.5 | — | — | — | — | — | |
| AKSBackbone=LLaVAVideo-7B, input frames=82026.06 | 99 | 45.7 | 12.6 | 19.2 | — | — | — | — | 48.1 | — | — | — | — | — | |
| Uni3D-MoE2026.03 | 97.6 | 43.7 | 17.5 | 19 | — | — | — | — | 47.1 | — | — | — | — | — | |
| Video-3DBackbone=LLavAVideo-7B, input frames=82026.06 | 96.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT4Scene-HDMInput 2D=true, Input 3D=true2026.03 | 96.3 | 44.4 | 15.5 | 18.9 | — | 28.2 | 30.3 | 22.3 | 46.5 | — | — | — | — | — | |
| GPT4SceneModel Category=2D MLLMs2026.03 | 96.3 | — | — | 18.9 | 46.5 | 28.2 | — | — | — | — | — | — | — | — | |
| PAR3Dcategory=Generalist 3D-MLLMs2026.06 | 95.7 | — | 15.9 | 18.9 | — | — | — | — | 45 | — | — | — | — | — | |
| CoPE-VideoLM-7BPoint Encoder=No, Vision Encoder=Yes, Evaluation Protocol=Fine-tuned, Token Budget=25.48%2026.02 | 95.1 | — | 14.1 | 18.7 | 46 | 27.1 | — | — | — | — | — | — | — | — | |
| LLaVA-OV-FT (video-only)Size=7B2026.05 | 95.1 | — | — | 13.5 | — | — | — | — | 47.4 | — | — | 27.4 | 46.3 | — | |
| CdViewsModel Category=2D MLLMs2026.03 | 94 | — | — | — | 46.8 | 30.1 | — | — | — | — | — | — | — | — | |
| cdViewsBackbone=LLaVA-OV-7B, input frames=92026.06 | 94 | 42.6 | — | — | — | — | — | — | 46.8 | — | — | — | — | — | |
| KeyVTBackbone=LLaVA-OV-7B, input frames=8eq2026.06 | 93.8 | 41.7 | 12.4 | 17.9 | — | — | — | — | 46.7 | — | — | — | — | — | |
| Descrip3DVision modal.=I2026.05 | 93.7 | — | — | — | — | 22.67 | — | — | — | — | — | — | — | — | |
| Proxy3DVision modal.=I, # of tokens=700, Backbone=Qwen2.5-VL-7B2026.05 | 93.6 | — | — | — | — | 25.2 | — | — | — | — | — | — | — | — | |
| LLaVAVideo-7Binput frames=82026.06 | 93.4 | 43.9 | 12.2 | 18.4 | — | — | — | — | 45.9 | — | — | — | — | — | |
| MoE3DModality=PC, Model Category=3D LMM2025.11 | 92.7 | — | 15.8 | 18.4 | — | — | — | — | 43.5 | — | — | — | — | — | |
| 3D-LLaVAModality=PC, Model Type=3D LMM2025.01 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAModality=PC, Model Category=3D LMM2025.11 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAModel Category=3D MLLMs2026.03 | 92.6 | — | — | 18.4 | 43.1 | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVALLMs=Vicuna-1.5-7B [9], #Params=58.26M, FLOP=37.752026.02 | 92.6 | — | 17.1 | 18.4 | 43.1 | — | — | — | — | — | — | — | — | — | |
| 3D-LLaVAVideo Input Only=false2025.05 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAModel Category=3D/2.5D-Input Models, Video-Input Only=false2025.05 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAInput Modality=3D/2.5D-Input Models2025.05 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAinput frames=–2026.06 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAcategory=Generalist 3D-MLLMs2026.06 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| 3D-LLaVAInput Modality=3D/2.5D-Input Models2026.07 | 92.6 | — | 17.1 | 18.4 | — | — | — | — | 43.1 | — | — | — | — | — | |
| Struct2DModel Category=2D MLLMs2026.03 | 92.1 | — | — | 17.4 | 44.1 | — | — | — | — | — | — | — | — | — | |
| Spatial-MLLM2026.03 | 91.8 | 44.4 | 14.8 | 18.4 | — | — | — | — | 45 | — | — | — | — | — | |
| Spatial-MLLMInput 2D=true2026.03 | 91.8 | 44.4 | 14.8 | 18.4 | — | 26.3 | 28.8 | 21.9 | 45 | — | — | — | — | — | |
| SpatialMLLM-4BModel Category=2D MLLMs2026.03 | 91.8 | — | — | 18.4 | 45 | 26.3 | — | — | — | — | — | — | — | — | |
| Spatial-MLLM-4BVideo Input Only=true2025.05 | 91.8 | 44.4 | 14.8 | 18.4 | — | — | — | — | 45 | — | — | — | — | — | |
| Spatial-MLLM-4BVision modal.=I, # of tokens=31002026.05 | 91.8 | — | — | — | — | 26.3 | — | — | — | — | — | — | — | — | |
| Spatial-MLLM-4BModel Category=Video-Input Models, Video-Input Only=true2025.05 | 91.8 | 44.4 | 14.8 | 18.4 | — | — | — | — | 45 | — | — | — | — | — | |
| Spatial-MLLM-4BInput Modality=Video-Input Models2025.05 | 91.8 | 44.4 | 14.8 | 18.4 | — | 26.3 | 28.8 | 21 | 45 | — | — | — | — | — | |
| Spatial-MLLMVenue=NIPS’25, Input=RGB2026.06 | 91.8 | — | 14.8 | 18.4 | 45 | — | — | — | — | — | — | 26.3 | — | — | |
| Spatial-MLLMInput Modality=Video-Input Models2026.07 | 91.8 | 44.4 | 14.8 | 18.4 | — | — | 28.8 | 21.9 | 45 | — | — | 26.3 | — | — | |
| Fase3DLLMs=Vicuna-1.5-7B [9], #Params=12.11M, FLOP=2.092026.02 | 91.74 | — | 16.87 | 18.61 | 43.37 | — | — | — | — | — | — | — | — | — | |
| LLaVA-3D2025.12 | 91.7 | — | 14.5 | 20.7 | 50.1 | 27 | — | — | — | — | — | — | — | — | |
| LLaVA-3DPoint Encoder=No, Vision Encoder=Yes2026.02 | 91.7 | — | 14.5 | 20.7 | 50.1 | 27 | — | — | — | — | — | — | — | — | |
| LLaVA-3D2026.03 | 91.7 | — | 14.5 | 20.7 | — | — | — | — | 50.1 | — | — | — | — | — | |
| LLaVA-3DModel Category=3D MLLMs2026.03 | 91.7 | — | — | 20.7 | 50.1 | 27 | — | — | — | — | — | — | — | — | |
| LLaVA-3D2026.03 | 91.7 | — | 14.5 | 20.7 | — | 27 | — | — | 50.1 | — | — | — | — | — |