Reasoning on Math-VR (Pass@4)
74.3Pass@4SFT + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT + GRPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 74.3 | |
| AXPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 74.1 | |
| BaseModel Size=32B, Backbone=Qwen3-VL-Thinking2026.05 | 73.9 | |
| AXPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 72.1 | |
| SFTModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 72.1 | |
| SFT + GRPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 71.9 | |
| GRPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 70.5 | |
| GRPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 70.3 | |
| SFTModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 69.5 | |
| BaseModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 68.3 | |
| BaseModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 65.1 | |
| AXPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 60 | |
| SFT + GRPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 58 | |
| GRPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 52 | |
| SFTModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 49.2 | |
| BaseModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 28.9 |