3D Visual Question Answering on ScanQA (EM@1, EM@10)
30.1EM@1Video-3D LLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Video-3D LLMModality=RGB-D2025.11 | 30.1 | — | |
| LLaVA-3DModality=RGB-D2025.11 | 27 | — | |
| LEOModality=C-PC2025.11 | 24.5 | — | |
| Qwen2.5-VL-7BModality=RGB2025.11 | 23.7 | — | |
| UniScene3DInput=CPM2026.04 | 23.2 | 53.5 | |
| SceneVerseInput=PC2026.04 | 22.7 | 51.5 | |
| SceneVerseModality=C-PC2025.11 | 22.7 | 51.5 | |
| 3D-VisTAInput=PC2026.04 | 22.4 | 52.1 | |
| SplatTalkModality=RGB(GS), Grid inputs=H x W x 3, LoRA-tuned=true2025.11 | 22.4 | — | |
| 3D-ViSTAModality=C-PC2025.11 | 22.4 | 52.1 | |
| POMA-3DInput=PM2026.04 | 22.3 | 52.3 | |
| POMA-3D_specModality=PM2025.11 | 22.3 | 52.3 | |
| POMA-3D_llmModality=PM, Grid inputs=H x W x 3, LoRA-tuned=true2025.11 | 21.3 | — | |
| ScanQAModality=C-PC2025.11 | 21.1 | — | |
| FG-CLIPInput=I2026.04 | 20.9 | 49.9 | |
| FG-CLIPModality=PM2025.11 | 20.9 | 49.9 | |
| LLaVA-OV-7BModality=RGB2025.11 | 20.8 | — |