General Multimodal Evaluation on MMMU (val)
69.1AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o2025.07 | 69.1 | |
| D2DparReasoning Strategy=D2D, Variant=par, Backbone=Qwen2.5-VL-7B2025.07 | 67.6 | |
| D2DlocReasoning Strategy=D2D, Variant=loc, Backbone=Qwen2.5-VL-7B2025.07 | 66 | |
| Qwen2.5-VL-7B w/ GRPOReasoning Mode=Deliberate, Backbone=Qwen2.5-VL-7B2025.07 | 64.7 | |
| D2DjusReasoning Strategy=D2D, Variant=jus, Backbone=Qwen2.5-VL-7B2025.07 | 64.4 | |
| GPT-4V2025.07 | 63.1 | |
| D2IparReasoning Strategy=D2I, Variant=par, Backbone=Qwen2.5-VL-7B2025.07 | 61.6 | |
| D2IjusReasoning Strategy=D2I, Variant=jus, Backbone=Qwen2.5-VL-7B2025.07 | 61.4 | |
| D2IlocReasoning Strategy=D2I, Variant=loc, Backbone=Qwen2.5-VL-7B2025.07 | 61.1 | |
| Qwen2.5-VL-7B*Backbone=Qwen2.5-VL-7B2025.07 | 59.3 | |
| Qwen2.5-VL-7B w/ GRPO†Reasoning Mode=Intuitive, Backbone=Qwen2.5-VL-7B2025.07 | 59.1 | |
| InternVL2.5-8B2025.07 | 56 | |
| Qwen2-VL-7B2025.07 | 54.1 | |
| InternVL2-8B2025.07 | 52.6 |