Multimodal Mathematical Reasoning on LogicVista
75.2AccuracyGemini-2.5-Pro-Thinking
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-Pro-ThinkingAccess Type=Closed-Source2025.12 | 75.2 | |
| Seed-1.5-thinkingAccess Type=Closed-Source2025.12 | 71.8 | |
| Claude-4-SonnetAccess Type=Closed-Source2025.12 | 64.4 | |
| GPT-4.1Access Type=Closed-Source2025.12 | 63.8 | |
| CEPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 61.16 | |
| RLSDBackbone=Qwen3-VL-4B-Instruct2026.05 | 56.92 | |
| OPSDBackbone=Qwen3-VL-4B-Instruct2026.05 | 55.58 | |
| GRPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 54.98 | |
| BaseBackbone=Qwen3-VL-4B-Instruct2026.05 | 54.91 | |
| Revisual-R1Access Type=Open-Source, Model Scale=7B2025.12 | 52.3 | |
| SDPOBackbone=Qwen3-VL-4B-Instruct2026.05 | 52.01 | |
| VAPO-ThinkerAccess Type=Open-Source, Model Scale=7B2025.12 | 50.9 | |
| MMR1-Math-v0Access Type=Open-Source, Model Scale=7B2025.12 | 50.8 | |
| Vision-G1Access Type=Open-Source, Model Scale=7B2025.12 | 50.2 | |
| OursAccess Type=Open-Source, Model Scale=7B2025.12 | 49.9 | |
| Vision-R1Training Data=Mixed Data, Backbone=Qwen2.5-VL-7B2026.03 | 49.7 | |
| RL(GRPO)Training Data=Geo3K, Backbone=Qwen2.5-VL-7B2026.03 | 49.6 | |
| RL(GRPO)Training Data=MMR1, Backbone=Qwen2.5-VL-7B2026.03 | 49.4 | |
| RL(GRPO)Training Data=GeoQA, Backbone=Qwen2.5-VL-7B2026.03 | 49.2 | |
| VisionZeroTraining Data=ImgEdit, Backbone=Qwen2.5-VL-7B2026.03 | 49.1 | |
| SelfJudgeTraining Data=Geo3K, Backbone=Qwen2.5-VL-7B2026.03 | 49 | |
| VisionZeroTraining Data=CLEVR, Backbone=Qwen2.5-VL-7B2026.03 | 48.8 | |
| SelfJudgeTraining Data=MMR1, Backbone=Qwen2.5-VL-7B2026.03 | 48.6 | |
| VLAA-ThinkingAccess Type=Open-Source, Model Scale=7B2025.12 | 48.5 | |
| SFTTraining Data=MMR1, Backbone=Qwen2.5-VL-7B2026.03 | 48.1 | |
| MM-UPTTraining Data=MMR1, Backbone=Qwen2.5-VL-7B2026.03 | 47.9 | |
| SelfJudgeTraining Data=GeoQA, Backbone=Qwen2.5-VL-7B2026.03 | 47.9 | |
| SFTTraining Data=GeoQA, Backbone=Qwen2.5-VL-7B2026.03 | 47.8 | |
| MM-UPTTraining Data=GeoQA, Backbone=Qwen2.5-VL-7B2026.03 | 47.3 | |
| SFTTraining Data=Geo3K, Backbone=Qwen2.5-VL-7B2026.03 | 47.2 | |
| EvoLMMTraining Data=Multi-Bench, Backbone=Qwen2.5-VL-7B2026.03 | 46.9 | |
| MM-UPTTraining Data=Geo3K, Backbone=Qwen2.5-VL-7B2026.03 | 46.9 | |
| MM-EurekaAccess Type=Open-Source, Model Scale=7B2025.12 | 46.8 | |
| R1-Onevision-7BTraining Data=Mixed Data, Backbone=Qwen2.5-VL-7B2026.03 | 46.5 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.03 | 46.3 | |
| OpenVLThinker-8BTraining Data=Mixed Data, Backbone=Qwen2.5-VL-7B2026.03 | 46.3 | |
| Qwen2.5-VLAccess Type=Open-Source, Model Scale=7B2025.12 | 45 | |
| VL-RethinkerAccess Type=Open-Source, Model Scale=7B2025.12 | 44.5 | |
| OpenVLThinkerAccess Type=Open-Source, Model Scale=7B2025.12 | 41.4 | |
| ThinkLite-VLAccess Type=Open-Source, Model Scale=7B2025.12 | 40.7 | |
| CEPOBackbone=Qwen3-VL-2B-Instruct2026.05 | 37.72 | |
| GRPOBackbone=Qwen3-VL-2B-Instruct2026.05 | 37.5 | |
| RLSDBackbone=Qwen3-VL-2B-Instruct2026.05 | 36.38 | |
| BaseBackbone=Qwen3-VL-2B-Instruct2026.05 | 32.81 | |
| SDPOBackbone=Qwen3-VL-2B-Instruct2026.05 | 29.46 | |
| OPSDBackbone=Qwen3-VL-2B-Instruct2026.05 | 28.79 |