Mathematical Reasoning on MathVision MVisionm
41.3AccuracyGemini-2.0-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.0-FlashSampling Strategy=avg@8, Inference Temperature=12026.01 | 41.3 | |
| GPT4-oSampling Strategy=avg@8, Inference Temperature=12026.01 | 30.6 | |
| CPPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 29.9 | |
| NoisyRolloutBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 29.4 | |
| Vision-SR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 28 | |
| PerceptionR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 27.6 | |
| GRPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 27.6 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 27.5 | |
| PAPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 26.5 | |
| Look-BackBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 25.8 | |
| CPPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 25.3 | |
| Vision-MattersBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 25.2 | |
| GRPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 25.1 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 24.5 | |
| PAPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 24.3 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 22.3 | |
| Visionary-R1Backbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 19.7 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 19.5 |