Mathematical Reasoning on MathVista MVistam
73.4AccuracyGemini-2.0-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.0-FlashSampling Strategy=avg@8, Inference Temperature=12026.01 | 73.4 | |
| CPPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 72.2 | |
| PAPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 71.6 | |
| GRPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 71.2 | |
| NoisyRolloutBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 71.1 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 70.7 | |
| PerceptionR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 70 | |
| Look-BackBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 69.1 | |
| Vision-MattersBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 68.6 | |
| Vision-SR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 67 | |
| CPPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 66.3 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 65.6 | |
| PAPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 64.8 | |
| CoVTBackbone=Qwen2.5VL-7B2026.05 | 64.3 | |
| GRPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 63.7 | |
| Unsilencing Latent ReasoningBackbone=Qwen2.5VL-7B2026.05 | 63.7 | |
| LVRRFBackbone=Qwen2.5VL-7B2026.05 | 62.6 | |
| MonetBackbone=Qwen2.5VL-7B2026.05 | 62.4 | |
| Visionary-R1Backbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 61.4 | |
| LVRBackbone=Qwen2.5VL-7B2026.05 | 61.4 | |
| GPT4-oSampling Strategy=avg@8, Inference Temperature=12026.01 | 60 | |
| OpenVLThinkerBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 60 | |
| DMLRBackbone=Qwen2.5VL-7B2026.05 | 59.1 | |
| ICoTBackbone=Qwen2.5VL-7B2026.05 | 58.9 | |
| VanillaBackbone=Qwen2.5VL-7B2026.05 | 58.7 | |
| CCoTBackbone=Qwen2.5VL-7B2026.05 | 57.8 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 56.4 | |
| MCoTBackbone=Qwen2.5VL-7B2026.05 | 56.4 | |
| DMLRBackbone=Qwen2.5VL-3B2026.05 | 51 | |
| Unsilencing Latent ReasoningBackbone=Qwen2.5VL-3B2026.05 | 50 | |
| ICoTBackbone=Qwen2.5VL-3B2026.05 | 49.8 | |
| LVRRFBackbone=Qwen2.5VL-3B2026.05 | 48.6 | |
| VanillaBackbone=Qwen2.5VL-3B2026.05 | 48.2 | |
| CCoTBackbone=Qwen2.5VL-3B2026.05 | 48 | |
| LVRBackbone=Qwen2.5VL-3B2026.05 | 47.5 | |
| MCoTBackbone=Qwen2.5VL-3B2026.05 | 47.3 |