Mathematical Reasoning on DynaMath (Pass@1)
83.3Pass@1Base
Evaluation Results
| Method | Links | |
|---|---|---|
| BaseBackbone=Qwen3-VL-Thinking, Model Size=32B2026.05 | 83.3 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 79 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 78.2 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 77.2 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 77.2 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 76.8 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 76.6 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 76.4 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 76.3 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=4B2026.05 | 76.2 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=8B2026.05 | 75.9 | |
| SFT + AXPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 66.9 | |
| SFT + GRPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 66.4 | |
| GRPOBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 64.9 | |
| SFTBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 64.1 | |
| BaseBackbone=Qwen3-VL-Thinking, Model Size=2B2026.05 | 60.5 | |
| PeRL-VLBackbone=Qwen2.5-VL-7B-Instruct2025.12 | 51.01 | |
| RL (Conditional Hard Gate)gamma=0, Backbone=Qwen2.5-VL-7B-Instruct2025.12 | 50.52 | |
| VL Cogito2025.12 | 50.42 | |
| ThinkLite7B2025.12 | 49.7 | |
| RL (Verifiable Rewards)gamma=1, Backbone=Qwen2.5-VL-7B-Instruct2025.12 | 49.62 | |
| PeBR-R1-7B2025.12 | 47.48 | |
| R1ShareVL7B2025.12 | 45.23 | |
| Base (Qwen2.5-VL-7B-Instruct)Backbone=Qwen2.5-VL-7B-Instruct2025.12 | 43.01 | |
| SelfRewarded-R1-7B2025.12 | 41.94 |