Code Reasoning on CRUXEval-O (pass@1)
41Pass@1GRPO with ground-truth reward
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO with ground-truth rewardModel=Qwen2.5-3B2026.05 | 41 | |
| Multi-rewardModel=Qwen2.5-3B2026.05 | 41 | |
| Multi-reward + KL-CovModel=Qwen2.5-3B2026.05 | 38.3 | |
| INTUITORModel=Qwen2.5-3B2026.05 | 36.1 | |
| GRPO with ground-truth rewardModel=Qwen2.5-1.5B2026.05 | 24.9 | |
| Multi-rewardModel=Qwen2.5-1.5B2026.05 | 21.8 | |
| Multi-reward + KL-CovModel=Qwen2.5-1.5B2026.05 | 20.5 | |
| INTUITORModel=Qwen2.5-1.5B2026.05 | 12.6 |