Code Generation on LiveCodeBench v6 (Avg@8, Pass@8)
43.22Avg@8SC-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SC-GRPOLearning Paradigm=Self-Conditioned GRPO2026.06 | 43.22 | 48.85 | |
| DAPOLearning Paradigm=Reinforcement Learning2026.06 | 40.74 | 44.27 | |
| REINFORCE++Learning Paradigm=Reinforcement Learning2026.06 | 39.69 | 44.27 | |
| GRPOLearning Paradigm=Reinforcement Learning2026.06 | 39.59 | 43.51 | |
| Qwen3-8BLearning Paradigm=Base Model2026.06 | 26.33 | 35.11 | |
| MiniMax-M2.7Learning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 26.05 | 35.88 | |
| DeepSeekv4-ProLearning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 26.05 | 35.88 | |
| OracleLearning Paradigm=On-Policy Self Distillation, Thinking Budget=Extended2026.06 | 25.38 | 36.64 |