3D Object Point Captioning on Objaverse LVIS XL (1K test)
32.2BLEU-1GPT4Point (FLANT5XL)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT4Point (FLANT5XL)Modality=Point-Text, Trainable Params=110M, Backbone=FLAN-T5-XL2023.12 | 32.2 | 7.2 | 14.2 | 35.5 | 78 | |
| GPT4Point (OPT6.7B)Modality=Point-Text, Trainable Params=110M, Backbone=OPT-6.7B2023.12 | 31.5 | 7.2 | 13.8 | 35.4 | 78.7 | |
| GPT4Point (OPT2.7B)Modality=Point-Text, Trainable Params=110M, Backbone=OPT-2.7B2023.12 | 28.9 | 6 | 13.2 | 33.9 | 68.4 | |
| Qwen-VL (Qwen-7B)Modality=Image-Text, Trainable Params=7.2B, Backbone=Qwen-7B2023.12 | 27.1 | 4.9 | 13.1 | 31.3 | 63.8 | |
| PointLLM (Vicuna-13B)Modality=Point-Text, Trainable Params=13.3B, Backbone=Vicuna-13B2023.12 | 26.2 | 4.9 | 11.9 | 31.3 | 50.9 | |
| InstructBLIP (Vicuna-1B)Modality=Image-Text, Trainable Params=202M, Backbone=Vicuna-1B2023.12 | 25.5 | 4.3 | 11.6 | 30.7 | 47.2 | |
| BLIP-2 (OPT6.7B)Modality=Image-Text, Trainable Params=188M, Backbone=OPT-6.7B2023.12 | 24.9 | 4.1 | 11.5 | 30 | 44.2 | |
| BLIP-2 (OPT2.7B)Modality=Image-Text, Trainable Params=188M, Backbone=OPT-2.7B2023.12 | 22.2 | 3 | 10.3 | 28.2 | 32.3 |