Mathematical Reasoning on Geo3k
52AccuracyNoisyRollout-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| NoisyRollout-7BModel Scale=7B, Rollout=82026.06 | 52 | |
| PRPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 46.9 | |
| VPPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 44.4 | |
| PAPO-DModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 44.1 | |
| R1-ShareVL-7BModel Scale=7B, Rollout=82026.06 | 41.2 | |
| VL-Rethinker-7BModel Scale=7B, Rollout=82026.06 | 40.7 | |
| MM-Eureka-7BModel Scale=7B, Rollout=82026.06 | 40.3 | |
| PAPO-GModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 40.3 | |
| GRPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 40.2 | |
| PRPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 37.3 | |
| Qwen2.5-VL-7BModel Scale=7B, Rollout=82026.06 | 36.7 | |
| DAPOModel Scale=7B, Base Model=Qwen2.5-VL-7B, Rollout=82026.06 | 35.9 | |
| VPPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 35.8 | |
| PAPO-DModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 35.7 | |
| DAPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 31.2 | |
| PAPO-GModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 31.1 | |
| GRPOModel Scale=3B, Base Model=Qwen2.5-VL-3B, Rollout=82026.06 | 28.7 | |
| Qwen2.5-VL-3BModel Scale=3B, Rollout=82026.06 | 18.8 |