Math Reasoning on GSM8K (pass@1)
84.9Pass@1 AccuracyGRPO with ground-truth reward
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO with ground-truth rewardModel=Qwen2.5-3B2026.05 | 84.9 | |
| Multi-rewardModel=Qwen2.5-3B2026.05 | 82.8 | |
| Multi-reward + KL-CovModel=Qwen2.5-3B2026.05 | 80.7 | |
| GRPO with ground-truth rewardModel=Qwen2.5-1.5B2026.05 | 74.9 | |
| INTUITORModel=Qwen2.5-3B2026.05 | 73.3 | |
| Multi-rewardModel=Qwen2.5-1.5B2026.05 | 69.5 | |
| Multi-reward + KL-CovModel=Qwen2.5-1.5B2026.05 | 68.3 | |
| INTUITORModel=Qwen2.5-1.5B2026.05 | 22.4 |