Coding Reasoning on Codecontests
65.8Pass RateGDPO_2-obj
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GDPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 65.8 | 14.3 | 13.2 | |
| GRPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 65.6 | 19.3 | 3.9 | |
| GDPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 65.6 | 15.8 | 2.5 | |
| GRPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 63.2 | 14.2 | 14.1 | |
| DeepSeek-R1-7B (Baseline)Reward Optimization Objective=None, Base Model=DeepSeek-R1-7B2026.01 | 47.3 | 83 | 29.7 |