Multimodal Reasoning on MathVista (Accuracy, AvgLen, Ratio)
85.9AccuracyQwen3-VL-32B-Thinking
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-32B-ThinkingParameters=32B, Thinking Mode=true2026.01 | 85.9 | — | — | |
| Qwen3-VL-8B-ThinkingParameters=8B, Thinking Mode=true2026.01 | 81.4 | — | — | |
| EvoCUA-32BParameters=32B2026.01 | 80.4 | — | — | |
| Token-ReplayModel=Qwen3-VL, #Params=32B2026.06 | 79.4 | — | — | |
| PRCRModel=Qwen3-VL, #Params=32B2026.06 | 79.2 | — | — | |
| BaselineModel=Qwen3-VL, #Params=32B2026.06 | 78.5 | — | — | |
| RLSDBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 78.1 | — | — | |
| GRPOBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 76.2 | — | — | |
| GRPO + OPSDBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 75.9 | — | — | |
| EvoCUA-8BParameters=8B2026.01 | 75.8 | — | — | |
| OPSDBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 75.1 | — | — | |
| TGRL-DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 75 | — | — | |
| PRCRModel=InternVL3.5, #Params=8B2026.06 | 74.6 | — | — | |
| NoisyRolloutData=6.4K2026.03 | 74.5 | — | — | |
| Token-ReplayModel=InternVL3.5, #Params=8B2026.06 | 74.3 | — | — | |
| Perception-R1Data=1.4K2026.03 | 74.2 | — | — | |
| SDPOBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 74 | — | — | |
| Base LLMBase Model=Qwen3-VL-8B-Instruct, Max Context Length=81922026.04 | 73.8 | — | — | |
| VL-RethinkerTool=✗, Param Size=7B2025.11 | 73.7 | — | — | |
| BaselineModel=InternVL3.5, #Params=8B2026.06 | 73.7 | — | — | |
| TGRL-GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 73.2 | — | — | |
| PRCRModel=InternVL3.5, #Params=14B2026.06 | 73 | — | — | |
| PRCRModel=Qwen3-VL, #Params=8B2026.06 | 72.8 | — | — | |
| ThinkLiteData=11K2026.03 | 72.7 | — | — | |
| Token-ReplayModel=InternVL3.5, #Params=14B2026.06 | 72.7 | — | — | |
| MM-EurekaTool=✗, Param Size=7B2025.11 | 72.6 | — | — | |
| Token-ReplayModel=Qwen3-VL, #Params=8B2026.06 | 72.6 | — | — | |
| ThinkLite-VL-7BTraining Protocol=Zero RL2025.12 | 71.9 | — | — | |
| DeepEyesV2Tool=General, Param Size=7B2025.11 | 71.9 | — | — | |
| BaselineModel=InternVL3.5, #Params=14B2026.06 | 71.9 | — | — | |
| VLAA-ThinkerTool=✗, Param Size=7B2025.11 | 71.7 | — | — | |
| InternVL3Tool=✗, Param Size=8B2025.11 | 71.6 | — | — | |
| ThinkLiteTool=✗, Param Size=7B2025.11 | 71.6 | — | — | |
| OpenVLThinkerData=50K2026.03 | 71.5 | — | — | |
| TGRL-GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 71.5 | — | — | |
| BaselineModel=Qwen3-VL, #Params=8B2026.06 | 71.5 | — | — | |
| TGRL-DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 71.4 | — | — | |
| DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 71.3 | — | — | |
| MM-Eureka-Qwen-7BTraining Protocol=Zero RL2025.12 | 71.2 | — | — | |
| MSSRModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 71.1 | — | — | |
| OpenCUA-72BParameters=72B2026.01 | 70.9 | — | — | |
| GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 70.9 | — | — | |
| GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 70.5 | — | — | |
| GPT-4.1VLM Category=Proprietary VLMs2025.09 | 70.4 | — | — | |
| InternVL3-8BVLM Category=Open-source VLMs2025.09 | 70.4 | — | — | |
| DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 70.3 | — | — | |
| DeepEyesTool=Crop, Param Size=7B2025.11 | 70.1 | — | — | |
| DeepEyes-7BVLM Category=Tool-Calling VLMs2025.09 | 70.1 | — | — | |
| OpenVLThinker-7BTraining Protocol=SFT + RL2025.12 | 70 | — | — | |
| GRPOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 70 | — | — | |
| ThymeTool=Code, Param Size=7B2025.11 | 70 | — | — | |
| Thyme-VL-7BVLM Category=Tool-Calling VLMs2025.09 | 70 | — | — | |
| EvoCUA-OpenCUA-72BBase Model=OpenCUA-72B2026.01 | 69.4 | — | — | |
| RLOOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 69.2 | — | — | |
| DeepSketcher-7BVLM Category=Inner Visual Thought VLMs2025.09 | 69.1 | — | — | |
| VLAA-ThinkerData=25K2026.03 | 68.8 | — | — | |
| REINFORCE++Model=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 68.5 | — | — | |
| Visual-PRMPRM Trainable Params=7B2026.06 | 68.5 | — | — | |
| Qwen-2.5-VLTool=✗, Param Size=7B2025.11 | 68.3 | — | — | |
| Qwen2.5-VL-7BVLM Category=Open-source VLMs2025.09 | 68.2 | — | — | |
| VLAA-Thinker-7BTraining Protocol=SFT + RL2025.12 | 68 | — | — | |
| Qwen-2.5-VL-7BData=-2026.03 | 67.5 | — | — | |
| MMS-PRMPRM Trainable Params=0M2026.06 | 67.5 | — | — | |
| Qwen2.5-VL-7BTraining Protocol=Zero RL2025.12 | 67.2 | — | — | |
| Claude3.7-SonnetVLM Category=Proprietary VLMs2025.09 | 66.8 | — | — | |
| VL-PRM300KPRM Trainable Params=8B2026.06 | 65.7 | — | — | |
| Mulberry-Qwen-7BVLM Category=Open-source VLMs2025.09 | 65.1 | — | — | |
| URSAPRM Trainable Params=8B2026.06 | 64.9 | — | — | |
| Bagel-Zebra-CoT-7BVLM Category=Inner Visual Thought VLMs2025.09 | 64.7 | — | — | |
| R1-OnevisionData=165K2026.03 | 63.9 | — | — | |
| Mirage-7BVLM Category=Inner Visual Thought VLMs2025.09 | 63.7 | — | — | |
| MSSRModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 63 | — | — | |
| R1-Onevision-7BTraining Protocol=SFT + RL2025.12 | 62.9 | — | — | |
| GRPOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 61.7 | — | — | |
| SVIPPRM Trainable Params=7B2026.06 | 61.6 | — | — | |
| RLOOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 59.7 | — | — | |
| Qwen2.5-VL-3BTraining Protocol=Zero RL2025.12 | 59.5 | — | — | |
| LLaVA-OVTool=✗, Param Size=7B2025.11 | 58.6 | — | — | |
| VILASR-7BVLM Category=Tool-Calling VLMs2025.09 | 57.6 | — | — | |
| MathCoder-VLVLM Category=Open-source VLMs2025.09 | 55.1 | — | — | |
| REINFORCE++Model=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 47.7 | — | — | |
| Prune-on-LogicBackbone=Qwen3-VL, Evaluation Protocol=SFT2026.02 | 45.9 | 299.5 | 6.5 | |
| No CompressionBackbone=Qwen3-VL, Evaluation Protocol=SFT2026.02 | 45.7 | 511.6 | 11.2 | |
| XMCCBackbone=Qwen3-VL, Evaluation Protocol=SFT2026.02 | 45.3 | 91 | 2 | |
| StepEntropyBackbone=Qwen3-VL, Evaluation Protocol=SFT2026.02 | 43.9 | 251.3 | 5.7 | |
| XMCCBackbone=Qwen2.5-VL, Evaluation Protocol=SFT2026.02 | 37.6 | 89.7 | 2.4 | |
| Prune-on-LogicBackbone=Qwen2.5-VL, Evaluation Protocol=SFT2026.02 | 37.3 | 324.2 | 8.7 | |
| StepEntropyBackbone=Qwen2.5-VL, Evaluation Protocol=SFT2026.02 | 36.8 | 232.2 | 6.3 | |
| No CompressionBackbone=Qwen2.5-VL, Evaluation Protocol=SFT2026.02 | 35.8 | 524.1 | 14.6 |