3D Question Answering on ObjaXL-LVIS 1K (test)
27.6AccuracyGPT4Point (FLANT5XL)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT4Point (FLANT5XL)Modality=Point-Text, Trainable Params=110M, Backbone=FLAN-T5-XL2023.12 | 27.6 | 26.3 | 31.3 | |
| GPT4Point (OPT6.7B)Modality=Point-Text, Trainable Params=110M, Backbone=OPT-6.7B2023.12 | 27.1 | 26.2 | 30.4 | |
| PointLLM (Vicuna-13B)Modality=Point-Text, Trainable Params=13.3B, Backbone=Vicuna-13B2023.12 | 23.4 | 22.3 | 26.2 | |
| GPT4Point (OPT2.7B)Modality=Point-Text, Trainable Params=110M, Backbone=OPT-2.7B2023.12 | 22.1 | 23.4 | 25.3 | |
| Qwen-VL (Qwen-7B)Modality=Image-Text, Trainable Params=7.2B, Backbone=Qwen-7B2023.12 | 18.2 | 19.5 | 24.4 | |
| InstructBLIP (Vicuna-1B)Modality=Image-Text, Trainable Params=202M, Backbone=Vicuna-1B2023.12 | 15.9 | 16.2 | 20.1 | |
| BLIP-2 (OPT6.7B)Modality=Image-Text, Trainable Params=188M, Backbone=OPT-6.7B2023.12 | 15.4 | 15.1 | 18.3 | |
| BLIP-2 (OPT2.7B)Modality=Image-Text, Trainable Params=188M, Backbone=OPT-2.7B2023.12 | 13.4 | 14.2 | 16.8 |