Code Generation on CodeForces
24.89Avg@8CodeScaler
Evaluation Results
| Method | Links | |
|---|---|---|
| CodeScalerBase Model=Qwen3-14B-Base, Reward Feedback Source=CodeScaler2026.02 | 24.89 | |
| RLVR (Binary)Base Model=Qwen3-14B-Base, Reward Feedback Source=RLVR (Binary)2026.02 | 20.79 | |
| CodeScalerTraining Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=CodeScaler2026.02 | 19.96 | |
| CodeScalerBase Model=Qwen3-8B-Base, Reward Feedback Source=CodeScaler2026.02 | 19.61 | |
| RLVR (Binary)Base Model=Qwen3-8B-Base, Reward Feedback Source=RLVR (Binary)2026.02 | 16.43 | |
| CodeScalerTraining Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=CodeScaler2026.02 | 15.95 | |
| RLVR (Binary)Training Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=RLVR2026.02 | 15.65 | |
| CodeScalerTraining Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=CodeScaler2026.02 | 15.17 | |
| RLVR (Binary)Training Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=RLVR2026.02 | 14.1 | |
| AceCodeRMBase Model=Qwen3-14B-Base, Reward Feedback Source=AceCodeRM2026.02 | 13.35 | |
| RLVR (Binary)Training Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=RLVR2026.02 | 13.19 | |
| CodeScalerTraining Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=CodeScaler2026.02 | 12.17 | |
| RLVR (Binary)Training Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=RLVR2026.02 | 11.64 | |
| SkyworkRMBase Model=Qwen3-14B-Base, Reward Feedback Source=SkyworkRM2026.02 | 10.35 | |
| AceCodeRMBase Model=Qwen3-8B-Base, Reward Feedback Source=AceCodeRM2026.02 | 9.74 | |
| Qwen3-14B-BaseTraining Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=Base2026.02 | 8.45 | |
| Qwen3-14B-BaseTraining Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=Base2026.02 | 8.45 | |
| Qwen3-14B-BaseBase Model=Qwen3-14B-Base, Reward Feedback Source=None (Base)2026.02 | 8.45 | |
| SkyworkRMBase Model=Qwen3-8B-Base, Reward Feedback Source=SkyworkRM2026.02 | 8 | |
| Qwen3-8B-BaseTraining Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=Base2026.02 | 5.35 | |
| Qwen3-8B-BaseTraining Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=Base2026.02 | 5.35 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base, Reward Feedback Source=None (Base)2026.02 | 5.35 |