Multimodal Mathematical Reasoning on MathVerse (test)
64.9Accuracy (ALL)Human
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| HumanSource=Baseline2025.02 | 64.9 | 71.2 | 70.9 | 61.4 | 68.3 | — | — | — | |
| Vision-R1Base Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 52.4 | — | — | — | — | — | — | — | |
| GPT-4oSource=Closed-Source MLLM2025.02 | 50.8 | 59.8 | 50.3 | 48 | 46.5 | — | — | — | |
| FAST-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 50.6 | — | — | — | — | 201 | — | — | |
| GPT-4oModel Category=Closed-Source Models2026.01 | 49.9 | — | — | — | — | — | — | — | |
| MM-R1Base Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 49.8 | — | — | — | — | 283.9 | — | — | |
| GPRO-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 48.7 | — | — | — | — | 188.4 | — | — | |
| OpenVLThinkerBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 47.9 | — | — | — | — | 398.4 | — | — | |
| Qwen-VL-MaxModel Category=Closed-Source Models2026.01 | 47.3 | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 46.9 | — | — | — | — | 388.9 | — | — | |
| R1-OneVisionBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 46.4 | — | — | — | — | 631.5 | — | — | |
| Claude-3.5 SonnetModel Category=Closed-Source Models2026.01 | 46.3 | — | — | — | — | — | — | — | |
| GPRO-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 44.2 | — | — | — | — | 265.4 | — | — | |
| FAST-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 43 | — | — | — | — | 286.3 | — | — | |
| LMM-R1Base Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 41.8 | — | — | — | — | 423.9 | — | — | |
| MulberryBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 39.5 | — | — | — | — | 364.3 | — | — | |
| VirgoBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 36.7 | — | — | — | — | — | — | — | |
| Curr-ReFTBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 36.3 | — | — | — | — | 121.6 | — | — | |
| Qwen2.5-VL-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 34.6 | — | — | — | — | 362.3 | — | — | |
| Qwen2-VL-7BBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 31.9 | — | — | — | — | 388.9 | — | — | |
| MM-Verifier + MM-ReasonerSource=Proposed Method2025.02 | 25.7 | 30.2 | 26.3 | 25.3 | 23.2 | — | — | — | |
| Math-LLaVA-13BSource=Open-Source MLLM2025.02 | 22.9 | 27.3 | 24.9 | 24.5 | 21.7 | — | — | — | |
| Qwen-VL-PlusSource=Closed-Source MLLM2025.02 | 21.3 | 26 | 21.2 | 18.5 | 19.1 | — | — | — | |
| LLaVA-OneVision-7BSource=Open-Source MLLM2025.02 | 20.7 | 25.5 | 21.8 | 20.9 | 21.2 | — | — | — | |
| Qwen2-VL-7BSource=Open-Source MLLM2025.02 | 20.1 | 23.7 | 16.3 | 19 | 19.8 | — | — | — | |
| Deepseek-VLSource=Open-Source MLLM2025.02 | 19.3 | 23 | 23.2 | 20.2 | 18.4 | — | — | — | |
| llama-3.2-11B-VisionSource=Open-Source MLLM2025.02 | 17.8 | 19.2 | 17.9 | 15.6 | 15.5 | — | — | — | |
| G-LLaVA-7BSource=Open-Source MLLM2025.02 | 16.6 | 20.9 | 20.7 | 17.2 | 14.6 | — | — | — | |
| SPHINX-V2-13BSource=Open-Source MLLM2025.02 | 16.1 | 20.8 | 14.1 | 35.2 | 28.9 | — | — | — | |
| LLaVA-1.5-13BSource=Open-Source MLLM2025.02 | 12.7 | 17.1 | 12 | 12.6 | 12.7 | — | — | — | |
| RandomSource=Baseline2025.02 | 12.4 | 12.4 | 12.4 | 12.4 | 12.4 | — | — | — | |
| MiniGPT4-7BSource=Open-Source MLLM2025.02 | 12.2 | 12.3 | 12.9 | 12.5 | 14.8 | — | — | — | |
| mPLUG-Owl2-7BSource=Open-Source MLLM2025.02 | 10.3 | 11.6 | 11.4 | 11.1 | 9.4 | — | — | — | |
| DAPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | — | — | — | — | — | — | 47.75 | 50.79 | |
| DAPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | — | — | — | — | — | — | 40.48 | 51.8 | |
| DAPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 48.2 | 51.85 | |
| DAPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 41.36 | 53.06 | |
| FT-RLBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=FT-RL2026.03 | — | — | — | — | — | — | 46.88 | 49.37 | |
| GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | — | — | — | — | — | — | 45.94 | 50.18 | |
| GRPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | — | — | — | — | — | — | 41.12 | 51.17 | |
| GRPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 47.56 | 51 | |
| GRPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 42.1 | 51.98 | |
| GSPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | — | — | — | — | — | — | 49.87 | 51.4 | |
| GSPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | — | — | — | — | — | — | 41.62 | 54.14 | |
| GSPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 50.1 | 52.94 | |
| GSPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | — | — | — | — | — | — | 46.82 | 55.54 | |
| Qwen2.5-VL-7B-Instruct BaseBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | — | — | — | — | — | — | 45.56 | 47.68 | |
| Qwen3-VL-4B-Instruct BaseBackbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | — | — | — | — | — | — | 40.86 | 50.53 | |
| Step-GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=Step-GRPO2026.03 | — | — | — | — | — | — | 44.32 | 47.82 | |
| VPPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=VPPO2026.03 | — | — | — | — | — | — | 47.21 | 50.29 |