General-purpose Multimodal Understanding on MMStar
69.8AccuracyQwen3-VL-32B-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-32B-InstructBackbone model=Qwen3-VL-32B-Instruct2026.05 | 69.8 | — | — | |
| Vision-R1Backbone model=Qwen3-VL-4B2026.05 | 63.8 | — | — | |
| IVR-R1Backbone model=Qwen3-VL-4B2026.05 | 63.3 | — | — | |
| Vision-SR1Backbone model=Qwen3-VL-4B2026.05 | 63.1 | — | — | |
| IVR-R1Backbone model=Qwen2.5-VL-7B2026.05 | 61.1 | — | — | |
| Supervised Fine-tuning (before RL)Backbone model=Qwen3-VL-4B2026.05 | 58.9 | — | — | |
| Vision-R1Backbone model=Qwen2.5-VL-7B2026.05 | 58.3 | — | — | |
| Zero-shot Inference (before RL)Backbone model=Qwen3-VL-4B2026.05 | 58.3 | — | — | |
| Vision-SR1Backbone model=Qwen2.5-VL-7B2026.05 | 57.7 | — | — | |
| Supervised Fine-tuning (before RL)Backbone model=Qwen2.5-VL-7B2026.05 | 56.7 | — | — | |
| Qwen2.5-VL-32B-InstructBackbone model=Qwen2.5-VL-32B-Instruct2026.05 | 48.3 | — | — | |
| Qwen2.5-VL-72B-InstructBackbone model=Qwen2.5-VL-72B-Instruct2026.05 | 45.5 | — | — | |
| Zero-shot Inference (before RL)Backbone model=Qwen2.5-VL-7B2026.05 | 41.7 | — | — | |
| InternVLScale=7B2026.04 | — | 63.2 | 70.6 | |
| MUPOScale=7B2026.04 | — | 68.7 | 75.4 | |
| QwenVLScale=7B2026.04 | — | 59.2 | 74.8 | |
| R1-OVScale=7B2026.04 | — | 64.7 | 67.5 | |
| V-R1Scale=7B2026.04 | — | 66.3 | 68.9 | |
| VLAAScale=7B2026.04 | — | 66.1 | 69.1 |