Mathematical Multimodal Reasoning on MathVerse
81.4AccuracyGemini 2.5 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 2.5 ProTool=Code, Param Size=-2025.11 | 81.4 | |
| Qwen2.5-VL-7B + PGPOModel Size=7B, Optimization Strategy=PGPO2026.04 | 71.45 | |
| Qwen2.5-VL-7B + VPPOModel Size=7B, Optimization Strategy=VPPO2026.04 | 70.95 | |
| Qwen2.5-VL-7B + PAPOModel Size=7B, Optimization Strategy=PAPO2026.04 | 69.01 | |
| Qwen2.5-VL-7B + GRPOModel Size=7B, Optimization Strategy=GRPO2026.04 | 68.88 | |
| VL-Rethinker-7BModel Size=7B2026.04 | 68.8 | |
| R1-ShareVL-7BModel Size=7B2026.04 | 68.15 | |
| Qwen2.5-VL-7B + DAPOModel Size=7B, Optimization Strategy=DAPO2026.04 | 67.95 | |
| NoisyRollout-7BModel Size=7B2026.04 | 67.8 | |
| Gemini-2.0-ProModel Category=Proprietary Models2025.06 | 67.3 | |
| MM-Eureka-7BModel Size=7B2026.04 | 67.15 | |
| InternVL3.5-8B-MPOTraining=DF-GRPO2026.03 | 63.5 | |
| Vision-R1-72B*Params.=72B, additional data during RL training=true2025.03 | 63.2 | |
| Vision-R1-32B*Params.=32B, additional data during RL training=true2025.03 | 62.1 | |
| Qwen2.5-VL-3B + PGPOModel Size=3B, Optimization Strategy=PGPO2026.04 | 62.06 | |
| InternVL3.5-8B-MPOTraining=PRIME2026.03 | 61.9 | |
| MM-Eureka-32B-R-TAPModel Category=Open-Source Reasoning Models2026.03 | 61.8 | |
| InternVL3.5-8B-MPOTraining=GRPO2026.03 | 61.5 | |
| Qwen2.5-VL-3B + VPPOModel Size=3B, Optimization Strategy=VPPO2026.04 | 61.34 | |
| Qwen2.5-VL-32BTraining=DF-GSPO2026.03 | 61.3 | |
| Qwen2.5-VL-3B + PAPOModel Size=3B, Optimization Strategy=PAPO2026.04 | 60.81 | |
| Qwen2.5-VL-7B-Instruct + R-TAPModel Size=7B, Optimization=R-TAP2026.03 | 60.1 | |
| Gemini2-flash2026.03 | 59.3 | |
| Gemini-2-flashModel Category=Closed-Source Models2026.03 | 59.3 | |
| R1-ShareVL-32B2026.03 | 59 | |
| Qwen2.5-VL-3B + DAPOModel Size=3B, Optimization Strategy=DAPO2026.04 | 58.76 | |
| Qwen2.5-VL-3B + GRPOModel Size=3B, Optimization Strategy=GRPO2026.04 | 58.39 | |
| Qwen2.5-VL-72BModel Category=Larger MLLMs without Reasoning2025.12 | 57.6 | |
| Qwen-2.5-VL-72B2026.03 | 57.6 | |
| DIVA-GRPO-7B2026.03 | 57.6 | |
| Qwen-2.5-VL-72BModel Category=Open-Source General Models2026.03 | 57.6 | |
| Vision-R1Backbone=Vision-R1 (7B)2026.05 | 57.3 | |
| Qwen2.5-VL-32BTraining=GSPO2026.03 | 57.2 | |
| o12026.03 | 57 | |
| o1Model Category=Closed-Source Models2026.03 | 57 | |
| MM-Eureka-32BModel Category=Open-Source Reasoning Models2026.03 | 56.5 | |
| MM-Eureka-7B-R-TAPModel Category=Open-Source Reasoning Models2026.03 | 56.1 | |
| PDCRBackbone=Qwen2.5-VL-7B2026.05 | 55 | |
| InternVL3.5-8B-MPOTraining=MPO2026.03 | 54.8 | |
| Qwen2.5VL-72B x Qwen3-32BParam (B)=1042025.09 | 54.4 | |
| ToR-DAPOData Size=39K (ViRL-39K), Base Model=Qwen-2.5-VL-7B2026.03 | 54.3 | |
| PACRBackbone=Qwen2.5-VL-7B2026.05 | 54.3 | |
| GPT-4oTool=Code, Param Size=-2025.11 | 54 | |
| AStar (Qwen2.5-7B)OS Only=✓, Training-Free=✓, Prior Data=0.5K, Pre. Time=50 mins2025.02 | 53.9 | |
| DAPOBackbone=Qwen2.5-VL-7B2026.05 | 53.9 | |
| Qwen2.5-VL-7BTraining=DF-GSPO2026.03 | 53.7 | |
| ToR-DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 53.4 | |
| NoisyRollout-7BData Size=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 53.2 | |
| GRPOBackbone=Qwen2.5-VL-7B2026.05 | 53.2 | |
| ToR-GRPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 53 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Mode=Zero-shot2026.05 | 52.9 | |
| R1-ShareVL-7B2026.03 | 52.8 | |
| Qwen2.5-VL-7B-Instruct + NoisyRolloutModel Size=7B, Optimization=NoisyRollout2026.03 | 52.8 | |
| R1-ShareVL-7B2026.03 | 52.8 | |
| DeepEyesV2Tool=General, Param Size=7B2025.11 | 52.7 | |
| VisonR1 7BModel Category=Reasoning MLLMs2026.01 | 52.4 | |
| Vision-R1-7BParams.=7B2025.03 | 52.4 | |
| Vision-R1-7BModel Size=7B2026.03 | 52.4 | |
| Vision-R1Training Data=Mixed Data, Backbone=Qwen2.5-VL-7B2026.03 | 52.4 | |
| Vision-R1-7BData Size=200K+10K, Base Model=Qwen-2.5-VL-7B2026.03 | 52.4 | |
| Vision-R12026.03 | 52.4 | |
| Qwen2.5-VL-32BParams.=32B2025.03 | 52.3 | |
| ThinkLite-7B2026.03 | 52.2 | |
| Perception-R1Backbone=Perception-R1 (7B)2026.05 | 52.1 | |
| Claude3.7-Sonnet2026.03 | 52 | |
| Claude3.7-SonnetModel Category=Closed-Source Models2026.03 | 52 | |
| Claude-3.7-SonnetModel Category=Close-source Models2026.04 | 52 | |
| InternVL2.5-VL-78B2026.03 | 51.7 | |
| InternVL2.5-VL-78BModel Category=Open-Source General Models2026.03 | 51.7 | |
| Qwen2.5-VL-72BParams.=72B2025.03 | 51.3 | |
| InternVL3-78BParam (B)=782025.09 | 51 | |
| GRPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 50.8 | |
| Qwen2.5-VL-7BTraining=GSPO2026.03 | 50.8 | |
| GPT-4oModel Category=Close-source Models2026.04 | 50.8 | |
| Qwen2.5-VL-7B-Instruct + Vanilla GRPOModel Size=7B, Optimization=GRPO2026.03 | 50.7 | |
| DAPOData Size=2.1K (Geo3K), Base Model=Qwen-2.5-VL-7B2026.03 | 50.6 | |
| DR-MMSearchAgent (w/ SPAI)Model Category=Open-source Models2026.04 | 50.6 | |
| MM-Eureka-Qwen-7BModel Size=7B, Backbone=Qwen2026.03 | 50.5 | |
| MM-Eureka-Qwen-7BData Size=15K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.5 | |
| MM-Eureka-7BType=GRPO, OS Only=✓, Training-Free=✗, Prior Data=15K2025.02 | 50.3 | |
| MM-Eureka-7B2026.03 | 50.3 | |
| MM-Eureka-7BModel Category=Open-Source Reasoning Models2026.03 | 50.3 | |
| OpenVLThinker-8BTraining Data=Mixed Data, Backbone=Qwen2.5-VL-7B2026.03 | 50.3 | |
| GPT-4o2026.03 | 50.2 | |
| GPT-4oModel Category=Closed-Source Models2026.03 | 50.2 | |
| ThinkLite-7B-VLModel Size=7B2026.03 | 50.2 | |
| ThinkLite-7B-VLData Size=11K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.2 | |
| Adora-7B2026.03 | 50.1 | |
| ADORA-7BModel Category=Open-Source Reasoning Models2026.03 | 50.1 | |
| ADORA-7BModel Size=7B2026.03 | 50.1 | |
| Qwen-2.5-VL-32B2026.03 | 49.9 | |
| Qwen-2.5-VL-32BModel Category=Open-Source General Models2026.03 | 49.9 | |
| VLAA-Thinker-Qwen2.5-7BModel Size=7B, Backbone=Qwen2.52026.03 | 49.9 | |
| VLAA-Thinker-7BData Size=25K, Base Model=Qwen-2.5-VL-7B2026.03 | 49.9 | |
| Qwen2.5-VL-32BTraining=Base2026.03 | 49.9 | |
| ChatGPT-4o-latestParam (B)=-2025.09 | 49.9 | |
| GPT-4oModel Category=Proprietary Models2025.06 | 49.9 | |
| SFT-7B2026.03 | 49.6 | |
| AVATARbackbone=Qwen2.5-VL-7B2025.08 | 49.6 | |
| OursModel Category=Reasoning MLLMs, Training Strategy=DAPO2026.01 | 49.4 |