Coding Reasoning on Apps
68.3Pass RateGDPO_2-obj
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GDPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 68.3 | 5 | 23.5 | |
| GRPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 68.1 | 11.2 | 20.3 | |
| GDPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 67.8 | 8.5 | 18.8 | |
| GRPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 67.2 | 5.2 | 25 | |
| DeepSeek-R1-7B (Baseline)Reward Optimization Objective=None, Base Model=DeepSeek-R1-7B2026.01 | 28.1 | 73.9 | 32.9 |