Multi-modal Vision-Language Understanding on MMBench (dev)
70.4ScoreASPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 70.4 | 68.8 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=DPO2025.05 | 69.6 | 67.03 | |
| LLaVA-1.5-13BBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=Base2025.05 | 67.7 | 65.93 | |
| ASPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=ASPO2025.05 | 65.6 | 65.16 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=DPO2025.05 | 64.7 | 63.12 | |
| mPLUG-Owl2-7BBase Model=mPLUG-Owl2, Model Scale=7B, Optimization Protocol=Base2025.05 | 64.5 | — | |
| LLaVA-1.5-7BBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=Base2025.05 | 64.3 | 62.59 | |
| Qwen-VL-chat-7BBase Model=Qwen-VL-Chat, Model Scale=7B, Optimization Protocol=Base2025.05 | 60.6 | — | |
| IDEFICS-65BBase Model=IDEFICS, Model Scale=65B, Optimization Protocol=Base2025.05 | 54.5 | — | |
| IDEFICS-7BBase Model=IDEFICS, Model Scale=7B, Optimization Protocol=Base2025.05 | 48.2 | — | |
| Qwen-VL-7BBase Model=Qwen-VL, Model Scale=7B, Optimization Protocol=Base2025.05 | 38.2 | — | |
| LLaVA-7BBase Model=LLaVA, Model Scale=7B, Optimization Protocol=Base2025.05 | 34.1 | — | |
| ASPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 33.7 | 45.84 | |
| InstructBLIP-13BBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=Base2025.05 | 33.5 | 43.86 | |
| DPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=DPO2025.05 | 33.5 | 44.5 | |
| MiniGPT-4-7BBase Model=MiniGPT-4, Model Scale=7B, Optimization Protocol=Base2025.05 | 23 | — |