Code Generation on HumanEval, HumanEval+, LCB
69.5HumanEvalSMEPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SMEPOBackbone=Qwen3-8B-Base2026.05 | 69.5 | 62.2 | 45.3 | 59 | |
| GRPOBackbone=Qwen3-8B-Base, Strategy=Vanilla GRPO2026.05 | 67.7 | 59.8 | 42 | 56.5 | |
| SFTBackbone=Qwen3-8B-Base, Strategy=SFT2026.05 | 67.1 | 60.4 | 28.8 | 52.1 | |
| ExpertBackbone=Qwen3-8B-Base, Strategy=Naive expert trace2026.05 | 66.5 | 58.5 | 42 | 55.7 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B-Base, Stage=Base Model2026.05 | 63.4 | 55.5 | 35 | 51.3 |