Image-Text Reasoning on WeMath
68.29AccuracyDAPO + ReMind
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO + ReMindBase Model=Qwen3-VL-8B-Instruct2026.06 | 68.29 | |
| GRPO + ReMindBase Model=Qwen3-VL-8B-Instruct2026.06 | 66.38 | |
| RePOBase Model=Qwen3-VL-8B-Instruct2026.06 | 63.52 | |
| ExGRPOBase Model=Qwen3-VL-8B-Instruct2026.06 | 62.67 | |
| RLEPBase Model=Qwen3-VL-8B-Instruct2026.06 | 62.48 | |
| DAPOBase Model=Qwen3-VL-8B-Instruct2026.06 | 57.43 | |
| GRPOBase Model=Qwen3-VL-8B-Instruct2026.06 | 56.57 | |
| Base ModelBase Model=Qwen3-VL-8B-Instruct2026.06 | 54.1 |