Visual Commonsense on Visual Commonsense (VC)
59VC ScoreQwen2-VL-7B-Instruct*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2-VL-7B-Instruct*Model Scale=Large-Scale Instruct Models, Base=Qwen-2.5-7B-Inst., VLM trained on large-scale image–text data=true2024.06 | 59 | 63.7 | |
| LAMIModel Scale=Large-Scale Instruct Models, Base=Qwen-2.5-7B-Inst.2024.06 | 57.8 | 66 | |
| Llava-Next*Model Scale=Large-Scale Instruct Models, Base=Llama3-8B-Inst., VLM trained on large-scale image–text data=true2024.06 | 56.5 | 60.7 | |
| LAMIModel Scale=Large-Scale Instruct Models, Base=Llama3-8B-Inst.2024.06 | 55.6 | 62.7 | |
| LAMIModel Scale=Large-Scale Models, Base=Llama3-8B2024.06 | 55 | 62 | |
| Qwen-2.5-7B-InstructModel Scale=Large-Scale Instruct Models, Base=-2024.06 | 54.8 | 64.4 | |
| Llama3-8B-InstructModel Scale=Large-Scale Instruct Models, Base=-2024.06 | 53 | 61.2 | |
| Llama3-8BModel Scale=Large-Scale Models, Base=-2024.06 | 52 | 60.6 | |
| Llava-Next*Model Scale=Large-Scale Models, Base=Vicuna-7B, VLM trained on large-scale image–text data=true2024.06 | 50.3 | 53.1 | |
| LAMIModel Scale=Mid-Scale Models, Base=Gemma-2B2024.06 | 50.1 | 54.7 | |
| InstructBLIP*Model Scale=Large-Scale Models, Base=Vicuna-7B, VLM trained on large-scale image–text data=true2024.06 | 50.1 | 52.1 | |
| LAMIModel Scale=Large-Scale Models, Base=Vicuna-7B2024.06 | 48.6 | 55.1 | |
| Gemma-2BModel Scale=Mid-Scale Models, Base=-2024.06 | 45.6 | 52.7 | |
| Vicuna-7BModel Scale=Large-Scale Models, Base=-2024.06 | 45.1 | 53.4 | |
| LAMIModel Scale=Small-Scale Models, Base=GPT-22024.06 | 38.6 | 39.2 | |
| GPT-2Model Scale=Small-Scale Models, Base=-2024.06 | 30.3 | 35.6 |