Multimodal Mathematical Reasoning on GEOQA-8k (test)
65AccuracyD2Ijus
Evaluation Results
| Method | Links | |
|---|---|---|
| D2IjusReasoning Strategy=D2I, Variant=jus, Backbone=Qwen2.5-VL-7B2025.07 | 65 | |
| D2IlocReasoning Strategy=D2I, Variant=loc, Backbone=Qwen2.5-VL-7B2025.07 | 60.6 | |
| D2IparReasoning Strategy=D2I, Variant=par, Backbone=Qwen2.5-VL-7B2025.07 | 60.5 | |
| DGPOBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 59.95 | |
| GPGBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 59.02 | |
| DAPOBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 59.02 | |
| GRPO-ADBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 58.09 | |
| Dr.GRPOBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 57.96 | |
| GRPOBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 57.43 | |
| GSPOBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 57.16 | |
| Qwen2.5-VL-7B w/ GRPOReasoning Mode=Deliberate, Backbone=Qwen2.5-VL-7B2025.07 | 54.9 | |
| D2DlocReasoning Strategy=D2D, Variant=loc, Backbone=Qwen2.5-VL-7B2025.07 | 54.5 | |
| Qwen2.5-VL-7B w/ GRPO†Reasoning Mode=Intuitive, Backbone=Qwen2.5-VL-7B2025.07 | 53.1 | |
| D2DparReasoning Strategy=D2D, Variant=par, Backbone=Qwen2.5-VL-7B2025.07 | 52.1 | |
| Qwen2.5-VL-7B*Backbone=Qwen2.5-VL-7B2025.07 | 46.6 | |
| Base ModelBackbone=Qwen2.5-VL-3B-Instruct2026.01 | 39.79 | |
| D2DjusReasoning Strategy=D2D, Variant=jus, Backbone=Qwen2.5-VL-7B2025.07 | 28.9 |