Mathematical Reasoning on MMK12
82.8AccuracyPRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PRPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 82.8 | |
| PAPO-DModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 80.6 | |
| VPPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 80.1 | |
| DAPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 75.9 | |
| GRPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 72.3 | |
| PAPO-GModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 71.8 | |
| R1-ShareVL-7BModel Scale=7B, Rollout=82026.06 | 70.9 | |
| VL-Rethinker-7BModel Scale=7B, Rollout=82026.06 | 68.3 | |
| MM-Eureka-7BModel Scale=7B, Rollout=82026.06 | 67.7 | |
| PRPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 66.9 | |
| DAPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 66.8 | |
| VPPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 65.3 | |
| PAPO-DModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 64.1 | |
| GRPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 57.2 | |
| PAPO-GModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 56.3 | |
| NoisyRollout-7BModel Scale=7B, Rollout=82026.06 | 51 | |
| Qwen2.5-VL-7BModel Scale=7B, Rollout=82026.06 | 43.3 | |
| Qwen2.5-VL-3BModel Scale=3B, Rollout=82026.06 | 37.1 |