Mathematical Reasoning on WeMath (test)
82.9AccuracyQwen3-VL-8B-Instruct + DUPL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8B-Instruct + DUPLModel Size=8B, Optimization=DUPL2025.10 | 82.9 | |
| Qwen3-VL-8B-Instruct + GRPOModel Size=8B, Optimization=GRPO2025.10 | 77.6 | |
| Qwen3-VL-4B-Instruct + DUPLModel Size=4B, Optimization=DUPL2025.10 | 76.6 | |
| Qwen3-VL-4B-Instruct + GRPOModel Size=4B, Optimization=GRPO2025.10 | 76.3 | |
| Qwen3-VL-8B-InstructModel Size=8B2025.10 | 70.5 | |
| Qwen3-VL-4B-InstructModel Size=4B2025.10 | 65.9 |