Multimodal Reasoning on MMReason (Accuracy)
20.5AccuracyDUPL
Evaluation Results
| Method | Links | |
|---|---|---|
| DUPLBackbone=Qwen2.5-VL-7B, Training Algorithm=DUPL2025.10 | 20.5 | |
| GRPOBackbone=Qwen2.5-VL-7B, Training Algorithm=GRPO2025.10 | 18.9 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2025.10 | 16.8 |