Math Reasoning on MMLU-Pro (pass@1)
40.3pass@1GRPO with ground-truth reward
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO with ground-truth rewardModel=Qwen2.5-3B2026.05 | 40.3 | |
| Multi-rewardModel=Qwen2.5-3B2026.05 | 39.3 | |
| Multi-reward + KL-CovModel=Qwen2.5-3B2026.05 | 39 | |
| INTUITORModel=Qwen2.5-3B2026.05 | 33.1 | |
| GRPO with ground-truth rewardModel=Qwen2.5-1.5B2026.05 | 31.6 | |
| Multi-reward + KL-CovModel=Qwen2.5-1.5B2026.05 | 29.9 | |
| Multi-rewardModel=Qwen2.5-1.5B2026.05 | 27.7 | |
| INTUITORModel=Qwen2.5-1.5B2026.05 | 24.5 |