Multimodal Math Reasoning on MathVista (avg@8 accuracy)
69.53Avg@8 AccuracyPAPO_G
Evaluation Results
| Method | Links | |
|---|---|---|
| PAPO_GBackbone=Qwen2.5-VL, Model Size=7B, Training Algorithm=PAPO_G, Inference Temperature=1.02025.07 | 69.53 | |
| PAPO_DBackbone=Qwen2.5-VL, Model Size=7B, Training Algorithm=PAPO_D, Inference Temperature=1.02025.07 | 67.53 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=7B, Training Algorithm=GRPO, Inference Temperature=1.02025.07 | 65.48 | |
| PAPO_DBackbone=Qwen2.5-VL, Model Size=3B, Training Algorithm=PAPO_D, Inference Temperature=1.02025.07 | 62.53 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=7B, Training Algorithm=DAPO, Inference Temperature=1.02025.07 | 61.91 | |
| PAPO_GBackbone=Qwen2.5-VL, Model Size=3B, Training Algorithm=PAPO_G, Inference Temperature=1.02025.07 | 61.38 | |
| DAPOBackbone=Qwen2.5-VL, Model Size=3B, Training Algorithm=DAPO, Inference Temperature=1.02025.07 | 60.89 | |
| GRPOBackbone=Qwen2.5-VL, Model Size=3B, Training Algorithm=GRPO, Inference Temperature=1.02025.07 | 59.34 | |
| PAPO_GBackbone=Qwen3-VL (thinking), Model Size=2B, Training Algorithm=PAPO_G, Inference Temperature=1.02025.07 | 56.08 | |
| GRPOBackbone=Qwen3-VL (thinking), Model Size=2B, Training Algorithm=GRPO, Inference Temperature=1.02025.07 | 53.58 |