Code-reasoning on LCB v6 (pass@1)
7.7Pass@1Multi-reward + KL-Cov
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi-reward + KL-CovModel=Qwen2.5-3B2026.05 | 7.7 | |
| INTUITORModel=Qwen2.5-3B2026.05 | 6.6 | |
| GRPO with ground-truth rewardModel=Qwen2.5-3B2026.05 | 6.4 | |
| Multi-rewardModel=Qwen2.5-3B2026.05 | 4.4 | |
| Multi-rewardModel=Qwen2.5-1.5B2026.05 | 3.3 | |
| Multi-reward + KL-CovModel=Qwen2.5-1.5B2026.05 | 2.6 | |
| GRPO with ground-truth rewardModel=Qwen2.5-1.5B2026.05 | 1.7 | |
| INTUITORModel=Qwen2.5-1.5B2026.05 | 0.8 |