Coding Reasoning on Taco
48.4Pass RateGDPO_2-obj
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GDPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 48.4 | 10.8 | 36.2 | |
| GRPO_2-objReward Optimization Objective=R_pass + R_length, Base Model=DeepSeek-R1-7B2026.01 | 45.1 | 11.8 | 37.7 | |
| GDPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 45.1 | 10.6 | 28 | |
| GRPO_3-objReward Optimization Objective=R_pass + R_length + R_Bug, Base Model=DeepSeek-R1-7B2026.01 | 44.4 | 14.7 | 30 | |
| DeepSeek-R1-7B (Baseline)Reward Optimization Objective=None, Base Model=DeepSeek-R1-7B2026.01 | 28.1 | 78 | 48.9 |