3D Visual Question Answering on nuScenes VQA
0.767AccuracyLLaVA-NeXT-Interleave
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-NeXT-Interleavemodel_size=14B2024.07 | 0.767 | |
| LLaVA-NeXT-Interleavemodel_size=7B2024.07 | 0.765 | |
| GPT-4V2024.07 | 0.637 | |
| LLaVA-NeXT-Interleavemodel_size=0.5B2024.07 | 0.628 | |
| SparseOccVLAReference=Ours, Input=Image2026.01 | 0.608 | |
| CenterPoint+MCANReference=AAAI 24, Input=LiDAR2026.01 | 0.595 | |
| OmniDriveReference=CVPR 25, Input=Image2026.01 | 0.592 | |
| BEVDet+MCANReference=AAAI 24, Input=Image2026.01 | 0.579 | |
| LiDAR-LLMReference=AAAI 25, Input=LiDAR2026.01 | 0.486 | |
| LLaVAReference=NeurIPS 23, Input=Image2026.01 | 0.474 | |
| Mantismodel_size=7B2024.07 | 0.462 | |
| Flamingo2024.07 | 0.049 | |
| Point-Bind & LLM2024.07 | 0.033 | |
| 3D-LLM2024.07 | 0.004 |