Code Generation on HumanEval+, MBPP+, and BigCodeBench Aggregate
70.72Average ScoreCode-A1
Evaluation Results
| Method | Links | |
|---|---|---|
| Code-A1Code LLM=Qwen2.5-Coder-7B-Instruct2026.03 | 70.72 | |
| Self-PlayCode LLM=Qwen2.5-Coder-7B-Instruct2026.03 | 70.39 | |
| Golden TestsCode LLM=Qwen2.5-Coder-7B-Instruct2026.03 | 70.37 | |
| /Code LLM=Qwen2.5-Coder-7B-Instruct2026.03 | 68.35 | |
| Code-A1Code LLM=Qwen2.5-Coder-3B-Instruct2026.03 | 66.15 | |
| Golden TestsCode LLM=Qwen2.5-Coder-3B-Instruct2026.03 | 65.14 | |
| Self-PlayCode LLM=Qwen2.5-Coder-3B-Instruct2026.03 | 64.67 | |
| /Code LLM=Qwen2.5-Coder-3B-Instruct2026.03 | 60.84 | |
| Code-A1Code LLM=Qwen2.5-Coder-1.5B-Instruct2026.03 | 56.95 | |
| Golden TestsCode LLM=Qwen2.5-Coder-1.5B-Instruct2026.03 | 56.23 | |
| Self-PlayCode LLM=Qwen2.5-Coder-1.5B-Instruct2026.03 | 55.88 | |
| /Code LLM=Qwen2.5-Coder-1.5B-Instruct2026.03 | 51.21 |