Visual Logical Reasoning on LogicVista
70.02AccuracyCodePercept-32B-S1
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CodePercept-32B-S1LLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 70.02 | — | — | |
| Gemini2.5-ProLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 66.44 | — | — | |
| Qwen3-VL-32B-InstructLLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 66.44 | — | — | |
| CodePercept-32B-S1LLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 65.33 | — | — | |
| CodePercept-4B-S1LLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 64.65 | — | — | |
| CodePercept-8B-S1LLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 62.64 | — | — | |
| Qwen3-VL-32B-InstructLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 62.19 | — | — | |
| CodePercept-8B-S1LLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 61.52 | — | — | |
| CodePercept-4B-S1LLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 60.4 | — | — | |
| Qwen3-VL-235A22B-InstructLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 59.73 | — | — | |
| Claude-Opus 4.1-ThinkingLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 59.28 | — | — | |
| Qwen3-VL-8B-InstructLLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 58.16 | — | — | |
| Qwen3-VL-8B-InstructLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 56.82 | — | — | |
| Qwen3-VL-4B-InstructLLM Solver=Qwen3-235A22-Thinking [53]2026.03 | 56.82 | — | — | |
| Qwen3-VL-4B-InstructLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 54.14 | — | — | |
| Qwen3-VL-30A3B-InstructLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 53.69 | — | — | |
| GPT5-ThinkingLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 53.02 | — | — | |
| GPT4-oSampling Strategy=avg@8, Inference Temperature=12026.01 | 52.8 | — | — | |
| MiniCPM-V-4.5LLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 52.57 | — | — | |
| Qwen2.5-VL-72BLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 52.34 | — | — | |
| Gemini-2.0-FlashSampling Strategy=avg@8, Inference Temperature=12026.01 | 52.3 | — | — | |
| InternVL3.5-8BLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 51.68 | — | — | |
| Intern-S1-8BLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 51.23 | — | — | |
| GLM-4.1V-9BLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 51 | — | — | |
| VAPOModel Scale=7B2025.09 | 50.9 | — | — | |
| RuCL2026.02 | 49.66 | — | — | |
| Qwen2.5-VL-32BParameters=32B2026.02 | 49.26 | — | — | |
| MM-EurekaModel Scale=7B2025.09 | 48.5 | — | — | |
| VisionZero-RealWorldModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 48.44 | — | — | |
| Active-ZeroModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 48.21 | — | — | |
| CPPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 48.2 | — | — | |
| NoisyRolloutBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 47.9 | — | — | |
| MM-Eureka-7BParameters=7B2026.02 | 47.87 | — | — | |
| GRPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 47.4 | — | — | |
| PAPOModel Scale=7B, Decoding Strategy=greedy decoding2025.09 | 47.3 | — | — | |
| InternVL2.5-38BParameters=38B2026.02 | 47.21 | — | — | |
| VL-RethinkerModel Scale=7B2025.09 | 47.2 | — | — | |
| EvoLMMModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 46.65 | — | — | |
| Look-BackBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 46.3 | — | — | |
| VisionZero-ChartModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 46.21 | — | — | |
| VL-Rethinker-7BParameters=7B2026.02 | 46.08 | — | — | |
| GPT-4o2026.02 | 45.9 | — | — | |
| OpenVLThinkerBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.8 | — | — | |
| PAPOBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.8 | — | — | |
| PerceptionR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.5 | — | — | |
| KeyeVL1.5-8BLLM Solver=Qwen3-30A3-Thinking [53]2026.03 | 45.19 | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.1 | — | — | |
| Vision-MattersBackbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 45.1 | — | — | |
| VisPlayModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 45.09 | — | — | |
| R1-Onevision-7BParameters=7B2026.02 | 44.53 | — | — | |
| Claude-3.5-Sonnet2026.02 | 43.97 | — | — | |
| Vision-SR1Backbone=Qwen2.5-VL-7B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 43.2 | — | — | |
| Base ModelModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 43.08 | — | — | |
| Vision-R1-7BParameters=7B2026.02 | 42.94 | — | — | |
| ThinkLite-VL-7BParameters=7B2026.02 | 42.94 | — | — | |
| Base ModelModel Scale=7B2025.09 | 42.6 | — | — | |
| VisionZero-CLEVRModel Backbone=Qwen2.5-VL-7B-Instruct2026.02 | 41.29 | — | — | |
| Perception-R1-7BParameters=7B2026.02 | 40.94 | — | — | |
| CPPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 40.9 | — | — | |
| Active-ZeroModel Backbone=Qwen2.5-VL-3B-Instruct2026.02 | 40.62 | — | — | |
| PAPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 39.4 | — | — | |
| VisPlayModel Backbone=Qwen2.5-VL-3B-Instruct2026.02 | 39.29 | — | — | |
| Qwen2.5-VL-7BParameters=7B2026.02 | 39.26 | — | — | |
| InternVL2.5-8BParameters=8B2026.02 | 38.23 | — | — | |
| GRPOBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 37.7 | — | — | |
| OpenVLThinkerBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 37.4 | — | — | |
| Base ModelModel Backbone=Qwen2.5-VL-3B-Instruct2026.02 | 37.28 | — | — | |
| Visionary-R1Backbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 37.1 | — | — | |
| OpenVLThinker-7BParameters=7B2026.02 | 36.24 | — | — | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B, Sampling Strategy=avg@8, Inference Temperature=12026.01 | 32.4 | — | — | |
| InternVL2.5-8BParameters=8B2026.01 | — | 25.2 | 19 | |
| Janus-Pro-7BParameters=7B2026.01 | — | 20.4 | 27.9 | |
| LLaVA-OneVision-Qwen2-7BParameters=7B2026.01 | — | 20.6 | 25.3 | |
| MM-EurekaQwen-7BParameters=7B2026.01 | — | 34.6 | 22.8 | |
| Ours (RL)Training=RL2026.01 | — | 21.5 | 25.3 | |
| Ours (SFT)Training=SFT2026.01 | — | 28 | 31.6 | |
| Qwen2.5-VL-7B-InstructParameters=7B, Variant=Instruct2026.01 | — | 25.2 | 19 | |
| R1-onevision-RLTraining=RL2026.01 | — | 29 | 17.7 | |
| Thyme2026.01 | — | 33.6 | 19 |