Multi-modal Vision-Language Understanding on ScienceQA Image
71.8AccuracyASPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 71.8 | 68.8 | |
| LLaVA-1.5-13BBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=Base2025.05 | 71.6 | 65.93 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=DPO2025.05 | 70.2 | 67.03 | |
| mPLUG-Owl2-7BBase Model=mPLUG-Owl2, Model Scale=7B, Optimization Protocol=Base2025.05 | 68.7 | — | |
| Qwen-VL-chat-7BBase Model=Qwen-VL-Chat, Model Scale=7B, Optimization Protocol=Base2025.05 | 68.2 | — | |
| ASPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=ASPO2025.05 | 67.7 | 65.16 | |
| Qwen-VL-7BBase Model=Qwen-VL, Model Scale=7B, Optimization Protocol=Base2025.05 | 67.1 | — | |
| LLaVA-1.5-7BBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=Base2025.05 | 66.8 | 62.59 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=DPO2025.05 | 66.4 | 63.12 | |
| BLIP-2-7BBase Model=BLIP-2, Model Scale=7B, Optimization Protocol=Base2025.05 | 61 | — | |
| ASPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 45.1 | 45.84 | |
| InstructBLIP-13BBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=Base2025.05 | 44.7 | 43.86 | |
| DPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=DPO2025.05 | 44.3 | 44.5 | |
| LLaVA-7BBase Model=LLaVA, Model Scale=7B, Optimization Protocol=Base2025.05 | 38.5 | — |