Multimodal Reasoning on MathVerse
68.5AccuracyPAPOG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PAPOGBackbone=Qwen2.5-VL-7B2026.06 | 68.5 | — | |
| CFPOGBackbone=Qwen2.5-VL-7B, Hyperparameters=gamma=0.02 + No Ent2026.06 | 68.47 | — | |
| GRPOBackbone=Qwen2.5-VL-7B2026.06 | 66.51 | — | |
| OpenMMReasoner-7BEvaluation Source=original paper2026.05 | 63.8 | — | |
| AnE-3rdTraining Stage=Round 32026.05 | 62.3 | — | |
| AnE-2ndTraining Stage=Round 22026.05 | 60.9 | — | |
| ADHintEvaluation Source=original paper2026.05 | 60.6 | — | |
| AnE-1stTraining Stage=Round 12026.05 | 60.5 | — | |
| NPOstage=early + late-stage2026.04 | 60 | — | |
| GRPOtype=pure on-policy2026.04 | 59.52 | — | |
| NPOstage=early-stage only2026.04 | 59.38 | — | |
| AutoNPO2026.04 | 59.11 | — | |
| RLEPtype=far future2026.04 | 58.91 | — | |
| ExGRPOtype=historical replay2026.04 | 56.89 | — | |
| Qwen2.5-VL-72B w/ RAPIDReasoning Framework=RAPID, Reasoner Model=GPT-OSS-120B-A5B2025.06 | 56.2 | — | |
| PyVision-ImageTooling Type=Dynamic Tooling2026.02 | 55.8 | — | |
| SRPOEvaluation Source=original paper2026.05 | 55.8 | — | |
| LUFFYtype=external teacher2026.04 | 55.58 | — | |
| MMR1Evaluation Source=original paper2026.05 | 55.4 | — | |
| TGRL-DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 55.21 | — | |
| Qwen3-VL-8B-Instruct2026.04 | 54.61 | — | |
| VL-Rethinker-72BModel Category=Open-Source2025.06 | 54.6 | — | |
| Athena-PRMPolicy Model=Qwen2.5-VL-72B, Best-of-N Evaluation=82025.06 | 54.6 | — | |
| Qwen2.5-VL-32B w/ RAPIDReasoning Framework=RAPID, Reasoner Model=Qwen3-8B2025.06 | 54.4 | — | |
| Qwen2.5-VL-32B w/ RAPIDReasoning Framework=RAPID, Reasoner Model=GPT-OSS-120B-A5B2025.06 | 54.3 | — | |
| Perception-R1Data=1.4K2026.03 | 54.3 | — | |
| VL-RethinkerEvaluation Source=original paper2026.05 | 54.2 | — | |
| Revisual-R1Evaluation Source=original paper2026.05 | 53.6 | — | |
| Preliminary RLTraining Phase=Warm-up2026.05 | 53.6 | — | |
| TGRL-DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 53.51 | — | |
| NoisyRolloutData=6.4K2026.03 | 53 | — | |
| SPARK-VL-7BEvaluation Source=original paper2026.05 | 53 | — | |
| DeepEyes-v2Tooling Type=Dynamic Tooling2026.02 | 52.7 | — | |
| DeepEyesV2Tool=General, Param Size=7B2025.11 | 52.7 | — | |
| ReVisual-R1-7BModel Category=Open-Source2025.06 | 52.7 | — | |
| TGRL-GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 52.5 | — | |
| Vision-R1Evaluation Source=reproduced2026.05 | 52.4 | — | |
| Qwen2.5-VL-7B w/ RAPIDReasoning Framework=RAPID, Reasoner Model=Qwen3-8B2025.06 | 52.2 | — | |
| MM-Eureka-32BModel Category=Open-Source2025.06 | 51.5 | — | |
| Athena-ORMPolicy Model=Qwen2.5-VL-72B, Best-of-N Evaluation=82025.06 | 51.2 | — | |
| TGRL-GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 51.08 | — | |
| InternVL3-78BModel Category=Open-Source2025.06 | 51 | — | |
| Metis-RISEEvaluation Source=original paper2026.05 | 51 | — | |
| GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.8 | — | |
| DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.8 | — | |
| Self-consistencyPolicy Model=Qwen2.5-VL-72B, Best-of-N Evaluation=82025.06 | 50.8 | — | |
| DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.6 | — | |
| GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 50.46 | — | |
| MM-Eureka-Qwen-7BTraining Protocol=Zero RL2025.12 | 50.3 | — | |
| ThinkLiteData=11K2026.03 | 50.2 | — | |
| Ovis2-34BModel Category=Open-Source2025.06 | 50.1 | — | |
| Qwen2.5-VL-32BReasoning Framework=Standard2025.06 | 50.1 | — | |
| VLAA-ThinkerData=25K2026.03 | 49.9 | — | |
| MSSRModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 49.8 | — | |
| LLaVA-Critic-R1Evaluation Source=original paper2026.05 | 49.7 | — | |
| Qwen2.5-VL-7B-InstructEvaluation Source=original paper2026.05 | 49.2 | — | |
| GPT-4.1VLM Category=Proprietary VLMs2025.09 | 48.9 | — | |
| Bagel-Zebra-CoT-7BVLM Category=Inner Visual Thought VLMs2025.09 | 48.8 | — | |
| Qwen2.5-VL-3B w/ RAPIDReasoning Framework=RAPID, Reasoner Model=Qwen3-8B2025.06 | 48.6 | — | |
| AIRTool=Yes2026.06 | 48.6 | — | |
| GRPOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 48.5 | — | |
| VLAA-Thinker-7BTraining Protocol=SFT + RL2025.12 | 48.2 | — | |
| InternVL3-38BModel Category=Open-Source2025.06 | 48.2 | — | |
| QVQ-72B-PreviewModel Category=Open-Source2025.06 | 48.2 | — | |
| OmniCaptionerMethod Category=Caption-then-Reason2025.06 | 48 | — | |
| OpenVLThinkerData=50K2026.03 | 48 | — | |
| OpenVLThinkerEvaluation Source=original paper2026.05 | 47.9 | — | |
| RLOOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 47.8 | — | |
| Gemini-2.0-FlashModel Category=Proprietary2025.06 | 47.7 | — | |
| VL-Rethinker-7BModel Category=Open-Source2025.06 | 47.5 | — | |
| ThinkLite-VL-7BTraining Protocol=Zero RL2025.12 | 47.3 | — | |
| DeepEyesTooling Type=Static Toolset2026.02 | 47.3 | — | |
| DeepEyesTool=Crop, Param Size=7B2025.11 | 47.3 | — | |
| Qwen2.5-VL-72BModel Category=Open-Source2025.06 | 47.3 | — | |
| DeepEyes-7BMethod Category=Tool-enabled2025.06 | 47.3 | — | |
| Qwen2.5-VL-72BReasoning Framework=Standard2025.06 | 47.3 | — | |
| Qwen2.5-VL-72BPolicy Model=Qwen2.5-VL-72B, Best-of-N Evaluation=82025.06 | 47.3 | — | |
| DeepEyesTool=Yes2026.06 | 47.3 | — | |
| CodeDanceTooling Type=Dynamic Tooling2026.02 | 46.8 | — | |
| Qwen2.5-VL-7B (Bo8)Training Strategy=GRPO, Sampling Strategy=Best-of-82025.06 | 46.8 | — | |
| Claude-3.7-SonnetModel Category=Proprietary2025.06 | 46.7 | — | |
| Claude3.7-SonnetVLM Category=Proprietary VLMs2025.09 | 46.7 | — | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 46.65 | — | |
| Self-InstructBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 46.4 | — | |
| Athena-PRMPolicy Model=Qwen2.5-VL-7B, Best-of-N Evaluation=82025.06 | 46.3 | — | |
| Qwen-2.5-VL-7BData=-2026.03 | 46.2 | — | |
| Self-Instruct + Solver FeedbackBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 46.17 | — | |
| MM-Eureka-7BModel Category=Open-Source2025.06 | 46.1 | — | |
| R1-OnevisionData=165K2026.03 | 46.1 | — | |
| R1-Onevision-7BTraining Protocol=SFT + RL2025.12 | 46 | — | |
| OpenVLThinker-7BTraining Protocol=SFT + RL2025.12 | 45.8 | — | |
| Qwen2.5-VL-7BTraining Protocol=Zero RL2025.12 | 45.8 | — | |
| Ovis2-16BModel Category=Open-Source2025.06 | 45.8 | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.02 | 45.6 | — | |
| Qwen-2.5-VLTool=✗, Param Size=7B2025.11 | 45.6 | — | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 45.58 | — | |
| CoT Cold-StartBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 45.41 | — | |
| Seed SetBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 45.23 | — | |
| Self-Instruct + R-ZeroBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 44.72 | — | |
| Qwen2.5VL-7B w/ GRPOTool=No2026.06 | 44.7 | — |