Multi-modal Vision-Language Understanding on MMBench CN
64.7Overall ScoreASPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 64.7 | 68.8 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=DPO2025.05 | 64.1 | 67.03 | |
| LLaVA-1.5-13BBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=Base2025.05 | 63.6 | 65.93 | |
| ASPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=ASPO2025.05 | 59.5 | 65.16 | |
| LLaVA-1.5-7BBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=Base2025.05 | 58.3 | 62.59 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=DPO2025.05 | 58.3 | 63.12 | |
| Qwen-VL-chat-7BBase Model=Qwen-VL-Chat, Model Scale=7B, Optimization Protocol=Base2025.05 | 56.7 | — | |
| IDEFICS-65BBase Model=IDEFICS, Model Scale=65B, Optimization Protocol=Base2025.05 | 38.1 | — | |
| InstructBLIP-13BBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=Base2025.05 | 26.3 | 43.86 | |
| DPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=DPO2025.05 | 26.1 | 44.5 | |
| ASPOBase Model=InstructBLIP, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 26 | 45.84 | |
| IDEFICS-7BBase Model=IDEFICS, Model Scale=7B, Optimization Protocol=Base2025.05 | 25.2 | — | |
| LLaVA-7BBase Model=LLaVA, Model Scale=7B, Optimization Protocol=Base2025.05 | 14.1 | — | |
| Qwen-VL-7BBase Model=Qwen-VL, Model Scale=7B, Optimization Protocol=Base2025.05 | 7.4 | — |