Multimodal Mathematical Reasoning on WeMath (test)
72.15AccuracyGSPO + KAWHI (Qwen3)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GSPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 72.15 | 55.54 | |
| GSPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 71.55 | 54.14 | |
| DAPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 71.23 | 53.06 | |
| GRPO + KAWHI (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 70.98 | 51.98 | |
| GRPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 70.31 | 51.17 | |
| DAPO (Qwen3)Backbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 69.67 | 51.8 | |
| Qwen3-VL-4B-Instruct BaseBackbone Model=Qwen3-VL-4B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 69.43 | 50.53 | |
| GSPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 59.71 | 52.94 | |
| GSPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GSPO2026.03 | 59.02 | 51.4 | |
| DAPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 58.21 | 51.85 | |
| GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=GRPO2026.03 | 58.1 | 50.18 | |
| DAPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=DAPO2026.03 | 57.98 | 50.79 | |
| GRPO + KAWHIBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=uniform reward, RL Method=KAWHI2026.03 | 57.84 | 51 | |
| VPPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=VPPO2026.03 | 57.12 | 50.29 | |
| FT-RLBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=FT-RL2026.03 | 56.78 | 49.37 | |
| Step-GRPOBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=fine-grained reward, RL Method=Step-GRPO2026.03 | 55.32 | 47.82 | |
| Qwen2.5-VL-7B-Instruct BaseBackbone Model=Qwen2.5-VL-7B-Instruct, Reward Strategy=none, RL Method=Base2026.03 | 54.32 | 47.68 |