Multimodal mathematical reasoning on MathVision (test)
60.3AccuracyOpenAI-o1
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI-o1#Data=/2025.06 | 60.3 | — | — | |
| Claude-3.7-Sonnet#Data=/2025.06 | 41.3 | — | — | |
| Qwen-VL-MaxModel Category=Closed-Source Models2026.01 | 39.3 | — | — | |
| Claude-3.5 SonnetModel Category=Closed-Source Models2026.01 | 37.9 | — | — | |
| Qwen2.5-VL-72B-IT#Data=/2025.06 | 37.9 | — | — | |
| GSPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 32.89 | — | 54.14 | |
| GSPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 32.57 | — | 52.94 | |
| DAPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 31.91 | — | 51.85 | |
| GPRO-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 31.2 | 195.6 | — | |
| GSPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 31.09 | — | 55.54 | |
| FAST-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 30.6 | 204.8 | — | |
| GPT-4oModel Category=Closed-Source Models2026.01 | 30.4 | — | — | |
| GPT-4o#Data=/2025.06 | 30.4 | — | — | |
| MM-R1Base Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 30.2 | 324.6 | — | |
| R1-OneVisionBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 29.9 | 692.8 | — | |
| OpenVLThinkerBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 29.6 | 457.2 | — | |
| GRPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 29.28 | — | 51 | |
| Perception-R1-7B#Data=1.4K2025.06 | 28.6 | — | — | |
| DAPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 28.43 | — | 53.06 | |
| VPPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=VPPO2026.03 | 28.42 | — | 50.29 | |
| GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 28.29 | — | 50.18 | |
| DAPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 28.21 | — | 50.79 | |
| DAPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 27.63 | — | 51.8 | |
| MM-Eureka-7B#Data=15K2025.06 | 27.6 | — | — | |
| GSPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 27.3 | — | 51.4 | |
| GPRO-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 27.1 | 298.6 | — | |
| FAST-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 26.8 | 323.5 | — | |
| VLAA-Thinker-7B#Data=25K2025.06 | 26.7 | — | — | |
| SophiaVL-R1-7B#Data=130K2025.06 | 26.6 | — | — | |
| FT-RLBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=FT-RL2026.03 | 26.12 | — | 49.37 | |
| Qwen2.5-VL-7BBase Model Scale=7B, Base Architecture=Qwen2.5-VL2026.01 | 25.6 | 443 | — | |
| LMM-R1Base Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 25.2 | 447.8 | — | |
| Qwen2.5-VL-7B-IT#Data=/2025.06 | 25.1 | — | — | |
| Step-GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=Step-GRPO2026.03 | 24.76 | — | 47.82 | |
| OpenVLThinker-7B#Data=25K2025.06 | 24.3 | — | — | |
| VirgoBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 24 | — | — | |
| MulberryBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 23.4 | 349.2 | — | |
| Qwen2.5-VL-7B-Instruct BaseBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 23.36 | — | 47.68 | |
| GRPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 23.03 | — | 51.98 | |
| GRPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 22.16 | — | 51.17 | |
| R1-OneVision-7B#Data=155K2025.06 | 21.9 | — | — | |
| Qwen3-VL-4B-Instruct BaseBackbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 21.38 | — | 50.53 | |
| Qwen2.5-VL-3BBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 21.2 | 450.6 | — | |
| Curr-ReFTBase Model Scale=3B, Base Architecture=Qwen2.5-VL2026.01 | 20.1 | 240.1 | — | |
| InternVL2.5-8B#Data=/2025.06 | 19.7 | — | — | |
| Qwen2-VL-7BBase Model Scale=7B, Base Architecture=Qwen2-VL2026.01 | 18.8 | 443 | — | |
| Qwen2-VL-7B-IT#Data=/2025.06 | 16.7 | — | — |