Multi-discipline Multimodal Understanding and Reasoning on MMMU
42.8Overall ScoreQwen2-VL-2B-Instruct (DPO, Full)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VL-2B-Instruct (DPO, Full)% Train=100, Train set=Full, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 42.8 | |
| Qwen2-VL-2B-Instruct (DPO, HighAvg.)% Train=33, Train set=HighAvg., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 42.6 | |
| Qwen2-VL-2B-Instruct (DPO, LowAvg.)% Train=33, Train set=LowAvg., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 42.2 | |
| Qwen2-VL-2B-Instruct (DPO, HighVar.)% Train=33, Train set=HighVar., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 42.1 | |
| Qwen2-VL-2B-Instruct (DPO, Random)% Train=33, Train set=Random, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 42 | |
| Qwen2-VL-2B-Instruct (Zeroshot)% Train=0, Train set=Zeroshot, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=None2025.05 | 41.1 |