Multimodal Reasoning on Overall Benchmarks Aggregate
63.16Average ScorePAPO_D
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PAPO_DBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 63.16 | 0.1754 | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 61.66 | 0.0439 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 58.78 | — | |
| PAPO_DBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 55.24 | 0.0554 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=7B2025.07 | 55.01 | — | |
| DAPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 52.4 | — | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 49.92 | 0.0436 | |
| PAPO_GBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 49.3 | 0.0525 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=3B2025.07 | 47.92 | — | |
| GRPOBackbone=Qwen3-VL (thinking), Model Size=2B2025.07 | 46.84 | — |