Reasoning on V* (Pass@4)
97.9Pass@4SFT + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT + GRPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 97.9 | |
| AXPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 97.9 | |
| BaseModel Size=32B, Backbone=Qwen3-VL-Thinking2026.05 | 97.4 | |
| SFT + GRPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 96.9 | |
| BaseModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 95.8 | |
| SFTModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 95.3 | |
| AXPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 95.3 | |
| SFT + GRPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 94.2 | |
| AXPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 94.2 | |
| GRPOModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 94.2 | |
| SFTModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 93.7 | |
| GRPOModel Size=4B, Backbone=Qwen3-VL-Thinking2026.05 | 92.7 | |
| BaseModel Size=8B, Backbone=Qwen3-VL-Thinking2026.05 | 92.7 | |
| SFTModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 91.1 | |
| BaseModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 81.7 | |
| GRPOModel Size=2B, Backbone=Qwen3-VL-Thinking2026.05 | 80.6 |