Semantic Object Identification on COST (val)
87.2CS ScoreVCoder LLaVA-1.5-13b
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VCoder LLaVA-1.5-13bInput Tokens=(seg) + (img) + (query)2023.12 | 87.2 | 11.6 | |
| VCoder LLaVA-1.5-7bInput Tokens=(seg) + (img) + (query)2023.12 | 86 | 12.8 | |
| COST IT LLaVA-1.5-7bInput Tokens=(img) + (query)2023.12 | 71.9 | 28.2 | |
| ImCoder LLaVA-1.5-7bInput Tokens=(img) + (img) + (query)2023.12 | 70.8 | 27.9 | |
| CogVLM-17bInput Tokens=(img) + (query)2023.12 | 40.6 | 75.9 | |
| LLaVA-1.5-7bInput Tokens=(img) + (query)2023.12 | 38.7 | 67.3 | |
| GPT-4VInput Tokens=(img) + (query)2023.12 | 38.4 | 83 | |
| LLaVA-1.5-13bInput Tokens=(img) + (query)2023.12 | 35.8 | 68.6 | |
| Soft-Prompted LLaVA-1.5-7bInput Tokens=(prompt) + (img) + (query)2023.12 | 26.8 | 63 | |
| InstructBLIP Vicuna-7bInput Tokens=(img) + (query)2023.12 | 17.5 | 91.2 | |
| MiniGPT-4 LLaMA-2-7bInput Tokens=(img) + (query)2023.12 | 6.2 | 94.9 | |
| VCoder LLaVA-1.5-13bInput Tokens=(seg) + (img) + (query)2023.12 | 0.89 | 0.1 | |
| VCoder LLaVA-1.5-7bInput Tokens=(seg) + (img) + (query)2023.12 | 0.886 | 0.104 | |
| ImCoder LLaVA-1.5-7bInput Tokens=(img) + (img) + (query)2023.12 | 0.789 | 0.227 | |
| COST IT LLaVA-1.5-7bInput Tokens=(img) + (query)2023.12 | 0.787 | 0.221 | |
| Soft-Prompted LLaVA-1.5-7bInput Tokens=(prompt) + (img) + (query)2023.12 | 0.362 | 0.567 | |
| CogVLM-17bInput Tokens=(img) + (query)2023.12 | 0.334 | 0.675 | |
| LLaVA-1.5-7bInput Tokens=(img) + (query)2023.12 | 0.306 | 0.601 | |
| LLaVA-1.5-13bInput Tokens=(img) + (query)2023.12 | 0.25 | 0.693 | |
| InstructBLIP Vicuna-7bInput Tokens=(img) + (query)2023.12 | 0.142 | 0.858 | |
| MiniGPT-4 LLaMA-2-7bInput Tokens=(img) + (query)2023.12 | 0.062 | 0.922 |