Coding Reasoning on Codeforces
71.2Pass RateGDPO_2-obj
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GDPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 71.2 | 18.4 | 5.6 | |
| GRPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 69.5 | 16.9 | 2.5 | |
| GDPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 69.4 | 13.6 | 1.8 | |
| GRPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 68.1 | 18.1 | 7 | |
| DeepSeek-R1-7B (Baseline)Reward Optimization Objective=None, Base Model=DeepSeek-R1-7B2026.01 | 46.5 | 82.8 | 27.8 |