Coding on HumanEval Base (pass@1)
91.5Pass@1KodCode-RL Step 256
Evaluation Results
| Method | Links | |
|---|---|---|
| KodCode-RL Step 256Size=7B-Inst, Training Setting=Training-based2026.05 | 91.5 | |
| HASP-Evolve + RSSize=7B-Inst, Training Setting=Training-based, Backbone=Qwen2.5-7B-Instruct2026.05 | 91 | |
| KodCode-RL Step 128Size=7B-Inst, Training Setting=Training-based2026.05 | 90.2 | |
| GPT-4oSize=~200B, Training Setting=Training-free / inference-time2026.05 | 90 | |
| HASP-Intervention (w. Teacher)Size=7B-Inst, Training Setting=Training-free / inference-time, Backbone=Qwen2.5-7B-Instruct2026.05 | 88 | |
| GPT-4o-miniSize=~8B, Training Setting=Training-free / inference-time2026.05 | 87 | |
| P-GRPO (Code+RM)Size=7B-Inst, Training Setting=Training-based2026.05 | 86.6 | |
| Prompt-Only SkillsSize=7B-Inst, Training Setting=Training-free / inference-time2026.05 | 86 | |
| GRPO (Code)Size=7B-Inst, Training Setting=Training-based2026.05 | 85.9 | |
| HASP-Intervention (PF-only)Size=7B-Inst, Training Setting=Training-free / inference-time, Backbone=Qwen2.5-7B-Instruct2026.05 | 84.5 | |
| AceCoderRuleSize=7B-Inst, Training Setting=Training-based2026.05 | 84.1 | |
| AceCoderRMSize=7B-Inst, Training Setting=Training-based2026.05 | 83.5 | |
| SFT (vanilla)Size=7B-Inst, Training Setting=Training-based2026.05 | 82 | |
| Qwen2.5-7B-InstructSize=7B-Inst, Training Setting=Training-free / inference-time2026.05 | 81.7 | |
| RA-Agent (multi-loop)Size=7B-Inst, Training Setting=Training-free / inference-time2026.05 | 76 |