Code Generation on LiveBench (Avg@8)
42.9Avg@8RLVR (Binary)
Evaluation Results
| Method | Links | |
|---|---|---|
| RLVR (Binary)Base Model=Qwen3-14B-Base, Reward Feedback Source=RLVR (Binary)2026.02 | 42.9 | |
| CodeScalerTraining Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=CodeScaler2026.02 | 41.69 | |
| RLVR (Binary)Training Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=RLVR2026.02 | 41.4 | |
| CodeScalerBase Model=Qwen3-14B-Base, Reward Feedback Source=CodeScaler2026.02 | 36.66 | |
| CodeScalerTraining Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=CodeScaler2026.02 | 36.23 | |
| RLVR (Binary)Training Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=RLVR2026.02 | 35.44 | |
| CodeScalerTraining Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=CodeScaler2026.02 | 33 | |
| CodeScalerTraining Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=CodeScaler2026.02 | 32.91 | |
| SkyworkRMBase Model=Qwen3-14B-Base, Reward Feedback Source=SkyworkRM2026.02 | 31.93 | |
| RLVR (Binary)Training Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=RLVR2026.02 | 31.44 | |
| RLVR (Binary)Training Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=RLVR2026.02 | 30.76 | |
| CodeScalerBase Model=Qwen3-8B-Base, Reward Feedback Source=CodeScaler2026.02 | 29.88 | |
| AceCodeRMBase Model=Qwen3-14B-Base, Reward Feedback Source=AceCodeRM2026.02 | 29.19 | |
| AceCodeRMBase Model=Qwen3-8B-Base, Reward Feedback Source=AceCodeRM2026.02 | 28.51 | |
| Qwen3-14B-BaseTraining Dataset=KodCode, Backbone Model=Qwen3-14B, Training Protocol=Base2026.02 | 28.02 | |
| Qwen3-14B-BaseTraining Dataset=rStarCoder, Backbone Model=Qwen3-14B, Training Protocol=Base2026.02 | 28.02 | |
| Qwen3-14B-BaseBase Model=Qwen3-14B-Base, Reward Feedback Source=None (Base)2026.02 | 28.02 | |
| RLVR (Binary)Base Model=Qwen3-8B-Base, Reward Feedback Source=RLVR (Binary)2026.02 | 27.05 | |
| SkyworkRMBase Model=Qwen3-8B-Base, Reward Feedback Source=SkyworkRM2026.02 | 26.36 | |
| Qwen3-8B-BaseTraining Dataset=KodCode, Backbone Model=Qwen3-8B, Training Protocol=Base2026.02 | 25.68 | |
| Qwen3-8B-BaseTraining Dataset=rStarCoder, Backbone Model=Qwen3-8B, Training Protocol=Base2026.02 | 25.68 | |
| Qwen3-8B-BaseBase Model=Qwen3-8B-Base, Reward Feedback Source=None (Base)2026.02 | 25.68 |