Multimodal mathematical reasoning on MathVista (test)
74.2AccuracyQwen-VL-Max
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-VL-MaxModel Category=Closed-Source Models2026.01 | 74.2 | — | |
| GPRO-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 74.2 | 115.3 | |
| FAST-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 73.8 | 120.7 | |
| Vision-R1Base Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 73.5 | — | |
| GSPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 72.1 | 55.54 | |
| GRPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 71.8 | 51.98 | |
| DAPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 71.21 | 53.06 | |
| GRPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 71.07 | 51.17 | |
| MM-R1Base Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 71 | 185.6 | |
| GSPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 70.5 | 54.14 | |
| Qwen3-VL-4B-Instruct BaseBackbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 70.43 | 50.53 | |
| OpenVLThinkerBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 70.2 | 305.7 | |
| GSPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 69.42 | 51.4 | |
| DAPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 69.4 | 51.8 | |
| GSPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 69.37 | 52.94 | |
| GRPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 69.3 | 51 | |
| DAPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 69.2 | 50.79 | |
| DAPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 69.08 | 51.85 | |
| VPPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=VPPO2026.03 | 68.42 | 50.29 | |
| GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 68.37 | 50.18 | |
| Qwen2.5-VL-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 68.2 | 189.1 | |
| Claude-3.5 SonnetModel Category=Closed-Source Models2026.01 | 67.7 | — | |
| FT-RLBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=FT-RL2026.03 | 67.68 | 49.37 | |
| Qwen2.5-VL-7B-Instruct BaseBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 67.47 | 47.68 | |
| Step-GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=Step-GRPO2026.03 | 66.87 | 47.82 | |
| GPRO-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 66.8 | 145.2 | |
| FAST-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 66.2 | 158.7 | |
| R1-OneVisionBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 64.1 | 402.5 | |
| GPT-4oModel Category=Closed-Source Models2026.01 | 63.8 | — | |
| LMM-R1Base Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 63.2 | 245 | |
| Qwen2.5-VL-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 62.3 | 212.9 | |
| MulberryBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 62.1 | 275 | |
| Curr-ReFTBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 61.9 | 95.9 | |
| Qwen2-VL-7BBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 58.2 | 265.9 |