Multimodal Reasoning on General Multimodal Reasoning Aggregate
65.83Average PerformancePAPO_D
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PAPO_DBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 65.83 | 15.61 | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 63.5 | 1.53 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 62.51 | — | |
| DAPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 57.58 | — | |
| PAPO_DBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 57.09 | 5 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 55.02 | — | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 53.39 | 3.38 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 51.89 | — | |
| PAPO_GBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 51.36 | 4.52 | |
| GRPOBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 49.13 | — |