Mathematical Reasoning on DynaMath DMath
56.9AccuracyCPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CPPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 56.9 | |
| NoisyRolloutBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 55.9 | |
| PerceptionR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 55.8 | |
| GRPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 55.6 | |
| PAPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 54.7 | |
| Vision-MattersBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 54.5 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 53.2 | |
| Vision-SR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 52.6 | |
| Look-BackBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 52.5 | |
| CPPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 48.9 | |
| GRPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.7 | |
| PAPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.4 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 43.9 | |
| Gemini-2.0-FlashSampling Strategy=avg@8, Inference Temperature=12026.01 | 42.1 | |
| Visionary-R1Backbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 41.2 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 35.6 | |
| GPT4-oSampling Strategy=avg@8, Inference Temperature=12026.01 | 34.5 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 33.7 |