Multimodal Visual Question Answering on MMBench
88.6ScoreQwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VLModel Size=72B2026.04 | 88.6 | |
| GIFTbackbone=Qwen3-VL 8B2025.10 | 87.2 | |
| Greedybackbone=Qwen3-VL 8B2025.10 | 86.9 | |
| Greedybackbone=Qwen2-VL 7B2025.10 | 84.6 | |
| GIFTbackbone=Qwen2-VL 7B2025.10 | 84.6 | |
| Qwen2.5-VLModel Size=7B2026.04 | 83.5 | |
| Qwen2.5-VLModel Size=7B, Reproduced=true2026.04 | 82.47 | |
| ForeSightModel Size=7B2026.04 | 81.5 | |
| GIFTbackbone=LLaVA-1.5 13B2025.10 | 75.8 | |
| Greedybackbone=LLaVA-1.5 13B2025.10 | 75.6 | |
| Greedybackbone=LLaVA-1.5 7B2025.10 | 73.1 | |
| GIFTbackbone=LLaVA-1.5 7B2025.10 | 73.1 | |
| Qwen2-VL-2B-Instruct (DPO, HighAvg.)% Train=33, Train set=HighAvg., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 72.7 | |
| Qwen2-VL-2B-Instruct (DPO, LowAvg.)% Train=33, Train set=LowAvg., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 72.3 | |
| Qwen2-VL-2B-Instruct (Zeroshot)% Train=0, Train set=Zeroshot, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=None2025.05 | 72 | |
| Qwen2-VL-2B-Instruct (DPO, HighVar.)% Train=33, Train set=HighVar., Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 72 | |
| Qwen2-VL-2B-Instruct (DPO, Random)% Train=33, Train set=Random, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 71.9 | |
| Qwen2-VL-2B-Instruct (DPO, Full)% Train=100, Train set=Full, Backbone=Qwen2-VL-2B-Instruct, Alignment Training Method=DPO2025.05 | 71.6 |