Multimodal Reasoning on MMKI2
80.61Avg@8 AccuracyPAPO_D
Evaluation Results
| Method | Links | |
|---|---|---|
| PAPO_DBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 80.61 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 75.93 | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 72.52 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 72.26 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 66.83 | |
| PAPO_DBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 64.09 | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 57.39 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 57.24 | |
| PAPO_GBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 48.57 | |
| GRPOBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 47.71 |