Mathematical Reasoning on We-Math mini (test)
86.4AccuracyPRISM + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PRISM + GRPOBase Model=Qwen3-VL-8B2026.04 | 86.4 | |
| PRISM + DAPOBase Model=Qwen3-VL-8B2026.04 | 86.2 | |
| PRISM + GSPOBase Model=Qwen3-VL-8B2026.04 | 85.9 | |
| + DAPOBase Model=Qwen3-VL-8B2026.04 | 84.3 | |
| PRISM + DAPOBase Model=Qwen3-VL-4B2026.04 | 83.9 | |
| PRISM + GRPOBase Model=Qwen3-VL-4B2026.04 | 82.9 | |
| PRISM + GSPOBase Model=Qwen3-VL-4B2026.04 | 82.3 | |
| + GSPOBase Model=Qwen3-VL-8B2026.04 | 80.8 | |
| + GRPOBase Model=Qwen3-VL-8B2026.04 | 79.7 | |
| + GSPOBase Model=Qwen3-VL-4B2026.04 | 78.4 | |
| + GRPOBase Model=Qwen3-VL-4B2026.04 | 77.8 | |
| + DAPOBase Model=Qwen3-VL-4B2026.04 | 77.2 | |
| + SFTBase Model=Qwen3-VL-8B2026.04 | 73.4 | |
| PRISMBase Model=Qwen3-VL-8B2026.04 | 73.1 | |
| InstructBase Model=Qwen3-VL-8B2026.04 | 71.7 | |
| InstructBase Model=Qwen3-VL-4B2026.04 | 70.7 | |
| + SFTBase Model=Qwen3-VL-4B2026.04 | 70.6 | |
| PRISMBase Model=Qwen3-VL-4B2026.04 | 67.5 | |
| PLM-HoneyBee-8BModel scale=7B-8B2025.10 | 66.1 | |
| Qwen2.5-VL-7B-InstructModel scale=7B-8B2025.10 | 61.1 | |
| PLM-HoneyBee-3BModel scale=3B-4B2025.10 | 59.3 | |
| InternVL-2.5-8BModel scale=7B-8B2025.10 | 56.6 | |
| InternVL-3-8B-InstructModel scale=7B-8B2025.10 | 55.7 | |
| InternVL-2.5-4BModel scale=3B-4B2025.10 | 55.6 | |
| PLM-HoneyBee-1BModel scale=1B2025.10 | 50.6 | |
| Qwen2.5-VL-3B-InstructModel scale=3B-4B2025.10 | 49.2 | |
| PLM-8BModel scale=7B-8B2025.10 | 47.9 | |
| PLM-3BModel scale=3B-4B2025.10 | 46.1 | |
| InternVL-2.5-1BModel scale=1B2025.10 | 38.7 | |
| InternVL-3-1B-InstructModel scale=1B2025.10 | 37.5 | |
| PLM-1BModel scale=1B2025.10 | 35.5 |